🐵指尖猴全新升级
第10课:评估与调试你的Agent
🔬

评估与调试你的Agent

给Agent做体检,用数据说话!

📖知识引入

🧪什么是Evals
评估测试集:一组任务+预期结果,跑完自动打分,好坏看数字不看感觉
📋建测试集
挑10~20个典型任务,标注「应调用哪个工具」「答案要点」,形成验收清单
🔍日志调试
把每圈messages打印出来,工具选没选对、参数对不对,一眼现形
🩺常见病
选错工具、参数瞎编、死循环、窗口爆仓——对症改提示词或工具描述
💡
改一行提示词后必跑一遍测试集:没有评估的优化,全靠玄学

🔍给你的Agent出考卷

test_cases = [
    {"input": "北京今天多少度?", "expect_tool": "get_weather"},
    {"input": "帮我算 12*345",   "expect_tool": "calculator"},
    {"input": "你好呀",           "expect_tool": None},  # 应直接回答
]

def run_eval(agent, cases):
    passed = 0
    for case in cases:
        used = agent.get_tool_used(case["input"])  # 记录它用了哪个工具
        ok = used == case["expect_tool"]
        passed += ok
        print(f"[{'通过' if ok else '翻车'}] {case['input']}"
              f" → 用了{used},期望{case['expect_tool']}")
    print(f"得分:{passed}/{len(cases)}")

run_eval(my_agent, test_cases)

评估三件套:测试集、自动跑分、逐条报告——工程师和玄学家的分水岭

🎯小测验

第1题:评估(Evals)的核心做法是?

第2题:Agent总是选错工具,最该先检查什么?

第3题:哪种现象说明Agent可能陷入死循环?

📝本课知识点

  • ✓评估=测试集+自动打分
  • ✓日志是调试的显微镜
  • ✓选错工具先查description
第10课完成!继续探索下一课吧 🚀