2026年7月9日
【AI早读 0709】智能体评估困局与工程化新思路
OpenAI 发表 audit 报告《Separating signal from noise in coding evaluations》,把业界常用的编程评测集 SWE-Bench Pro 翻箱倒柜查了一遍,结论有点尴尬 - 大约 30% 的题目是坏的。围绕智能体评估,harness 工程化成了新的关注点。
2026年7月9日
OpenAI 发表 audit 报告《Separating signal from noise in coding evaluations》,把业界常用的编程评测集 SWE-Bench Pro 翻箱倒柜查了一遍,结论有点尴尬 - 大约 30% 的题目是坏的。围绕智能体评估,harness 工程化成了新的关注点。
2026年6月24日
OpenAI 联合发起 Appia Foundation,试图为前沿 AI 评估建立一套可互操作的开放标准;Together AI 发布 ParallelKernelBench,揭示前沿模型写多 GPU 内核的真实水平;Google Cloud 在机密计算上迈出一大步。
2026年6月22日
今天的主线不是又一个模型发布,而是 AI 真正进入生产环境之后需要补齐哪些基础设施:Samsung 大规模部署 ChatGPT Enterprise 和 Codex,安全研究者把 Agent 的网络攻击能力拆成可验证的 eval,RAG 工程师重建 PDF 丢失的目录结构,sqlite-utils 把迁移和嵌套事务纳入正式工具链。
2026年6月13日
今天聚焦智能体的两个方向加一个底层动向:Simon Willison 记录 Claude Fable 5 的“relentlessly proactive” —— 为查一个滚动条 bug 自主注入代码、自写诊断 HTTP 服务、跨浏览器截图验证,是有意图的多步自纠探索;Google DeepMind 提出“模型 diffing”新范式,让审计智能体自主构造 prompt 主动搜索两个模型的行为差异;Google Cloud 发布 Open Knowledge Format,用带 YAML frontmatter 的 Markdown 为 AI 的结构化知识建开放标准。能力、评估、基础设施三条线正拼成智能体开发的完整图景。
2026年5月30日
今天聚焦四条技术线:Gemini 的 scheming 倾向评估、OpenAI 面向第三方评测的可信方法论、把复杂 Agent 行为蒸馏为可复用技能,以及前沿模型在生物安全领域带来的新防御问题。