第10课:评估与调试你的Agent
进度 0/12
🔬
评估与调试你的Agent
给Agent做体检,用数据说话!
📖知识引入
🧪什么是Evals
评估测试集:一组任务+预期结果,跑完自动打分,好坏看数字不看感觉
📋建测试集
挑10~20个典型任务,标注「应调用哪个工具」「答案要点」,形成验收清单
🔍日志调试
把每圈messages打印出来,工具选没选对、参数对不对,一眼现形
🩺常见病
选错工具、参数瞎编、死循环、窗口爆仓——对症改提示词或工具描述
💡
改一行提示词后必跑一遍测试集:没有评估的优化,全靠玄学
🔍给你的Agent出考卷
test_cases = [
{"input": "北京今天多少度?", "expect_tool": "get_weather"},
{"input": "帮我算 12*345", "expect_tool": "calculator"},
{"input": "你好呀", "expect_tool": None}, # 应直接回答
]
def run_eval(agent, cases):
passed = 0
for case in cases:
used = agent.get_tool_used(case["input"]) # 记录它用了哪个工具
ok = used == case["expect_tool"]
passed += ok
print(f"[{'通过' if ok else '翻车'}] {case['input']}"
f" → 用了{used},期望{case['expect_tool']}")
print(f"得分:{passed}/{len(cases)}")
run_eval(my_agent, test_cases)评估三件套:测试集、自动跑分、逐条报告——工程师和玄学家的分水岭
🎯小测验
第1题:评估(Evals)的核心做法是?
第2题:Agent总是选错工具,最该先检查什么?
第3题:哪种现象说明Agent可能陷入死循环?
📝本课知识点
- ✓评估=测试集+自动打分
- ✓日志是调试的显微镜
- ✓选错工具先查description
第10课完成!继续探索下一课吧 🚀
