博客/标签/模型评估

模型评估

5 篇文章

2026年6月22日

【AI早读 0622】企业 AI 落地与评估基建

今天的主线不是又一个模型发布,而是 AI 真正进入生产环境之后需要补齐哪些基础设施:Samsung 大规模部署 ChatGPT Enterprise 和 Codex,安全研究者把 Agent 的网络攻击能力拆成可验证的 eval,RAG 工程师重建 PDF 丢失的目录结构,sqlite-utils 把迁移和嵌套事务纳入正式工具链。

2026年6月13日

【AI早读 0613】智能体主动性飞跃与模型评估新范式

今天聚焦智能体的两个方向加一个底层动向:Simon Willison 记录 Claude Fable 5 的“relentlessly proactive” —— 为查一个滚动条 bug 自主注入代码、自写诊断 HTTP 服务、跨浏览器截图验证,是有意图的多步自纠探索;Google DeepMind 提出“模型 diffing”新范式,让审计智能体自主构造 prompt 主动搜索两个模型的行为差异;Google Cloud 发布 Open Knowledge Format,用带 YAML frontmatter 的 Markdown 为 AI 的结构化知识建开放标准。能力、评估、基础设施三条线正拼成智能体开发的完整图景。