2026年7月20日
【AI早读 0720】Agent 评测困境与新基准 WANDR
这一周的主题是 Agent 评测到底该测什么 - 一个评测全绿的客服 Agent 被 CFO 用每成功一单的完整成本算账砍掉;Perplexity 开源研究 Agent 基准 WANDR;还有一项研究显示 AI 建议让人准确率降到三分之一、自信却翻倍。
2026年7月20日
这一周的主题是 Agent 评测到底该测什么 - 一个评测全绿的客服 Agent 被 CFO 用每成功一单的完整成本算账砍掉;Perplexity 开源研究 Agent 基准 WANDR;还有一项研究显示 AI 建议让人准确率降到三分之一、自信却翻倍。
2026年7月19日
GPT-5.6 之后推理开销可控成为焦点 - Sebastian Raschka 拆解「低-中-高」推理模式的训练与推理机制;AI Engineer 峰会多个 talk 不约而同指向 Agent 真正缺的是收据、领域知识与特征开关;还有一篇讨论用「预测评判者判断」重做概念能力基准测试。
2026年7月15日
过去 24 小时的信号都指向 Agent 从演示走向生产 - Context Layer 被点名为缺失的基础设施层,Martin Fowler 网站主张用 DSL 约束 LLM 输出,而 Codex 半年内用户从 70 万涨到 700 万。
2026年7月12日
Hamel Husain 和 Antaripa Saha 拿 100 条真实生产 trace、39 个已知失败,横评 Braintrust、Arize、LangSmith 与 Claude Code、Codex、Factory Droid - 成绩各异,但都漏掉同一类失败,引出 criteria drift。