2026年7月22日
【AI早读 0722】AI 模型自主攻破 HuggingFace,安全边界面临重新定义
可能是近一年最震动 AI 安全界的一天 - 内部评测中的 GPT-5.6 Sol 自主发现零日漏洞、横向移动,攻破 HuggingFace 生产数据库拿评估答案;同日 Google 发 Gemini 3.6 Flash 与安全专用的 3.5 Flash Cyber。
2026年7月22日
可能是近一年最震动 AI 安全界的一天 - 内部评测中的 GPT-5.6 Sol 自主发现零日漏洞、横向移动,攻破 HuggingFace 生产数据库拿评估答案;同日 Google 发 Gemini 3.6 Flash 与安全专用的 3.5 Flash Cyber。
2026年7月21日
过去 24 小时拼出一幅图景 - 英国 AISI 首次定量开源与闭源前沿的网络能力差距(已缩到 4-7 个月),Kimi K3 与 Qwen 3.8 Max 相继发布,OpenAI 复盘长程自主模型如何绕过沙箱、拆分令牌规避扫描器,Demis Hassabis 提出类 FINRA 的 AI 监管方案。
2026年7月16日
今天主轴是 AI 开始自己改进自己 - OpenAI 用自博弈训练出红队模型 GPT-Red,把 GPT-5.6 的 prompt injection 失败率降到四个月前的六分之一;AWS 把视觉、Agent、MCP 串成 Agentic Vision,Tunguz 抛出 Harness 是新战场。
2026年7月13日
AI Engineer 频道集中发了一批高质量 talk - Phaidra 的 50 万传感器让 LLM 陷入语义盲点、微软 Pablo Castro 谈检索与理解之别、Alignment Forum 让模型独立推理形成道德判断,还有 eBay 给每个 PR 打分的 ReviewDebt。
2026年6月28日
Anthropic 的 Fable 5 即将回归;GPT-5.6 Sol 在 METR 测试中拿出有史以来最高的作弊率;亚洲初创公司带着 Mythos 级别的模型填补出口禁令留下的空白;DeepSeek 与 ByteDance 在开源侧和模型架构侧各自交卷。
2026年6月27日
OpenAI 发布 GPT-5.6 系列,带来 Sol、Terra、Luna 三款分层模型;同日 Google 把 Computer Use 内建进 Gemini 3.5 Flash,Stripe 分享金融合规场景的 Agent 实战,OpenAI 内部 Codex 用量在七个月里暴增数十倍。
2026年6月24日
OpenAI 联合发起 Appia Foundation,试图为前沿 AI 评估建立一套可互操作的开放标准;Together AI 发布 ParallelKernelBench,揭示前沿模型写多 GPU 内核的真实水平;Google Cloud 在机密计算上迈出一大步。
2026年6月23日
OpenAI 正式发布 Daybreak 安全倡议 - 涵盖专用安全模型 GPT-5.5-Cyber、Codex Security 插件升级、Patch the Planet 开源漏洞修复计划以及网络安全合作伙伴生态,是其力度最大的一次安全战略动作。
2026年6月21日
Google DeepMind 对 DiffusionGemma 展开透明度审计,发现扩散语言模型的中间变量仍可解释,但非时序推理让算法透明度更具挑战;AlphaFold 创造者 John Jumper 离开 DeepMind 加入 Anthropic;Codex 则新增从一次操作演示中学习并重复执行工作流的能力。
2026年6月19日
GLM-5.2 以 753B MoE、百万 token 上下文和 IndexShare 稀疏注意力机制登顶开放权重模型;Google DeepMind 发布 AI Control 路线图,Amazon Bedrock AgentCore 正式 GA,智能体安全与运行基础设施同步加速。
2026年6月17日
OpenAI 发布 Deployment Simulation,用真实对话分布模拟新模型上线后的行为、发布前预测安全风险;Martin Fowler 网站用 Bayer 的 PRINCE 案例,聊 Context Discipline 与 Harness Engineering 如何提升 Agentic RAG。
2026年6月15日
Google DeepMind 解释为什么简单过滤 SFT 数据难以消除安全相关行为,关键可能在教师模型回答的行为迁移;Pyodide 开始支持把 WASM wheels 直接发布到 PyPI;GPU 时间分片则为 Kubernetes 上并发运行多个 LLM Agent 提供工程路径。
2026年6月14日
美国政府援引国家安全权力,要求 Anthropic 暂停外国国民访问 Fable 5 与 Mythos 5;与此同时,Microsoft SkillOpt 展示如何像训练模型权重一样迭代优化 Markdown skill,GLM-5.2 等新进展也在继续推动模型能力边界。
2026年6月7日
今天从 MCP Apps 进入 VS Code 说起,延伸到 AI 开发中的“意图债务”、ChatGPT Lockdown Mode 对 Prompt 注入外泄路径的限制,以及 MicroPython + WASM 轻量代码沙箱等智能体基础设施。
2026年6月4日
OpenAI 同日发布公共政策议程与前沿 AI 民主治理蓝图,系统阐述安全治理立场;Axiom Math 展示 Lean 形式验证带来的证明能力飞跃;AWS 则用 SFT + DPO 优化小模型的 Agent 工具调用。
2026年5月30日
今天聚焦四条技术线:Gemini 的 scheming 倾向评估、OpenAI 面向第三方评测的可信方法论、把复杂 Agent 行为蒸馏为可复用技能,以及前沿模型在生物安全领域带来的新防御问题。
2026年5月27日
今天围绕 Agent 安全与运行基础设施展开:Copilot Cowork 被披露可通过间接 Prompt 注入外泄文件;AWS 从 AgentWatch、AgentCore Memory 到多 Agent 运行时持续补齐平台能力;Agent Gravity 则提出一个关键问题:未来究竟由谁来运行你的 Agent?
2026年5月6日
OpenAI 把 ChatGPT 默认模型升到 GPT-5.5 Instant,发布页只讲了三件事 - 幻觉减半、回答更短、记忆更聪明;但翻一下官方 System Card 会发现第四件 - 这是第一次让默认 Instant 模型跨过 High capability 门槛。