【AI早读 0611】Google AI 三连发:DiffusionGemma、Managed Agents 与 ML 遗忘审计
摘要
Google 昨天一天连发三项:用扩散架构把文本生成提速 4 倍的 DiffusionGemma、一行 SDK 背后拉起 4 vCPU 沙箱的 Gemini Managed Agents,以及给「机器遗忘」做置信度评估的审计框架。再加上 GitHub Copilot CLI 接入 LSP 拿到语义级代码理解,以及 Simon Willison 对 Claude Fable 5「静默拒绝」推理策略的观察。

Google 昨天密集放了三颗弹 - DiffusionGemma、Gemini Managed Agents 底层拆解,以及 ML 遗忘审计框架。每一颗都值得单独成篇,但挤在同一天就很有意思了。我会把这三条串起来讲,再补上 GitHub Copilot CLI 和 Claude Fable 5 的动向。
DiffusionGemma:用扩散模型加速文本生成
Google DeepMind 发布了 DiffusionGemma,一个用扩散(diffusion)架构做文本生成的模型。传统 LLM 是自回归的 - 一个 token 接一个 token 地预测,延迟与生成长度成正比。DiffusionGemma 换了一条路:从噪声开始,通过多步去噪逐步还原完整输出。这个设计让它在某些任务上达到 4 倍的速度提升。
这并不是说 diffusion 会取代自回归 - diffusion 在需要批量生成、对延迟不敏感的场景更合适。但 Google 在 Gemma 家族里塞进这条分支,说明他们正在认真探索自回归之外的路线。从 Simon Willison 的分析看,DiffusionGemma 目前还是研究性质的发布,但开放了权重和推理代码。
链接:DiffusionGemma: 4x faster text generation
Gemini Managed Agents:一行代码背后的沙箱
Philipp Schmid 写了一篇非常实操的拆解,讲 Google 的 Managed Agents 底层是怎么跑的。调用 interactions.create() 看起来只是一行 SDK,但背后拉起了一个完整的执行环境 - 4 vCPU、16 GB RAM 的 Linux 沙箱,Gemini 3.5 Flash 作为编排器,在推理、工具调用、代码执行的循环里反复迭代,直到任务完成。
值得注意的设计:沙箱环境可以通过 environment_id 跨调用持久化 - 第一次装好依赖,第二次直接复用。而且 Preview 期间环境计算不收费,只收模型 token 的费用。这对做原型验证来说是个不错的体验。
链接:How Gemini Managed Agents Works under the Hood
Google Research:ML 遗忘审计框架
同一天,Google Research 放出了一个用于审计机器学习“遗忘”(machine unlearning)的框架。它的核心问题很直接:如果一个模型声称已经“忘记”了某批数据,你有多大把握相信它?团队提出了一个基于统计检验的方法,用来判断两组数据是否来自完全不同的分布 - 本质上是在给“遗忘”的声明做置信度评估。
这个方向在合规场景会越来越重要。欧盟 AI Act 已经提到了用户数据的“被遗忘权”,落实到模型层面需要可审计的方法论。
链接:New framework for auditing machine unlearning
GitHub Copilot CLI 接入 LSP
GitHub 博客发了篇很实用的文章:给 GitHub Copilot CLI 配上 Language Server Protocol(LSP)。之前 Copilot CLI 理解代码靠的是 grep、解 JAR、翻 node_modules - 文本级别的暴力搜索。接上 LSP 之后,agent 可以发送 textDocument/definition 这类语义请求,拿到精确的类型、签名和引用位置。
文章里详细展示了怎么通过 Agent Skill 自动安装和配置 LSP 服务器,目前支持 14 种语言。如果你用 Copilot CLI 写代码,这个技能值得一试。
链接:Give GitHub Copilot CLI real code intelligence with language servers
Claude Fable 5 余波
Claude Fable 5 的热度还没退。Simon Willison 写了条很妙的观察:“If Claude Fable stops helping you, you'll never know” - Fable 5 采用了“有节制”的推理策略,模型遇到不擅长的任务时会直接不出声,而不是输出不确定的内容。这对可靠性可能是好事,但对用户来说,一个静默拒绝的模型比一个会犯错但坦诚的模型更难调试。
Latent Space 的 AINews 也专门做了一期 Fable 5 的解读,标题叫 “Mythos but Safe, with Controversial Terms” - 暗示 Fable 5 在安全和能力之间的取舍比之前更激进。
链接:If Claude Fable stops helping you, you'll never know
来源:VerySmallWoods Research Feed - 2026-06-11 UTC
相关文章
2026年6月13日
【AI早读 0613】智能体主动性飞跃与模型评估新范式
今天聚焦智能体的两个方向加一个底层动向:Simon Willison 记录 Claude Fable 5 的“relentlessly proactive” —— 为查一个滚动条 bug 自主注入代码、自写诊断 HTTP 服务、跨浏览器截图验证,是有意图的多步自纠探索;Google DeepMind 提出“模型 diffing”新范式,让审计智能体自主构造 prompt 主动搜索两个模型的行为差异;Google Cloud 发布 Open Knowledge Format,用带 YAML frontmatter 的 Markdown 为 AI 的结构化知识建开放标准。能力、评估、基础设施三条线正拼成智能体开发的完整图景。
2026年7月10日
【AI早读 0710】GPT-5.6 三模型发布:Sol、Terra、Luna 开启高效智能新篇章
OpenAI 正式发布 GPT-5.6 系列,包含 Sol、Terra、Luna 三个尺寸 - 不是单一大模型,而是一个从效率到性能完整覆盖的家族。同日还有 ChatGPT Work、GPT-5.6 进入 M365 Copilot、GPT-Live 语音升级,以及 ARC-AGI-3 上 7.8% 成绩引发的争议。
2026年7月6日
【AI早读 0706】Claude Fable 写了一个正式版发布包,智能体编码进入实战阶段
Simon Willison 用 Claude Fable 写完了 sqlite-utils 4.0rc2 - 一个新增 1321 行、删除 190 行、覆盖 30 个文件的 pull request,总花费 149.25 美元。另外还有 MCP 应用层的新思考,以及智能体持续学习的前沿讨论。
最近一封 · Sample
grill-me:让 AI 反过来拷问你
“我们让 AI 写东西,常常是它还没搞明白你要什么就动手,结果返工。Matt Pocock 那个 17 万星 skills 仓库里最受欢迎的 grill-me 把这件事掉了个头 - 让 AI 在动手之前,先一个问题一个问题地把你拷问一遍。这篇聊聊它是什么、原理、怎么装,再拿我自己两次真实使用走一遍。”
—— william
来信
里面装的是
- 新文章 — 写完一篇就寄一封,不攒货
- 这周读到的、看到的、好用的工具
- 正在折腾的实验,附带翻车记录
约莫 1–2 周一封 · 随时退订
合作伙伴
CompeteMap — 英国及爱尔兰学生竞赛一站式搜索
数学、编程、科学、写作等各类竞赛信息汇总,支持按年龄和科目筛选,再也不错过报名截止日。