AGENT EVAL / BENCHMARK

从 0 到 1,
搭建可信的 Agent Eval 体系。

这里写 Agent Eval 里遇到的具体问题:指标怎么定、任务怎么设计、Grader 和 Harness 怎么写、怎么接进 CI/CD、出了问题怎么复盘。

开始阅读 →

最新文章

全部文章 →
2026年8月18日 · 基础概念

为什么 Agent Eval 不能只看分数:从静态 Benchmark 到可执行任务

解释 Agent Eval 中对象、环境、证据与 oracle 如何共同限定一个分数可支持的结论,以及为何评测还应进入失败学习循环。

#agent-eval#benchmark#学习记录#HELM#AgentBench#SWE-bench#tau-bench

订阅入口(即将开放)

Newsletter 准备好后,这里会提供邮件订阅。现在可以先用 RSS 跟踪更新。

订阅 RSS →