2026年7月14日
【AI早读 0714】GPT-5.6 登陆 Bedrock,开源模型在生产端占比逼近三成
7 月 13 日 AI 圈的关键词是生产级基础设施 - OpenAI 的 GPT-5.6 全系登陆 Amazon Bedrock,Vercel 生产指数揭示开源模型 token 占比逼近三成,AWS 拿出多租户代理的 OBO 身份方案,Google Cloud 开源 k8s-aibom。
博客
记录 AI 系统、产品思考与创作者工作流的实践。
2026年7月14日
7 月 13 日 AI 圈的关键词是生产级基础设施 - OpenAI 的 GPT-5.6 全系登陆 Amazon Bedrock,Vercel 生产指数揭示开源模型 token 占比逼近三成,AWS 拿出多租户代理的 OBO 身份方案,Google Cloud 开源 k8s-aibom。
2026年7月13日
AI Engineer 频道集中发了一批高质量 talk - Phaidra 的 50 万传感器让 LLM 陷入语义盲点、微软 Pablo Castro 谈检索与理解之别、Alignment Forum 让模型独立推理形成道德判断,还有 eBay 给每个 PR 打分的 ReviewDebt。
2026年7月12日
Hamel Husain 和 Antaripa Saha 拿 100 条真实生产 trace、39 个已知失败,横评 Braintrust、Arize、LangSmith 与 Claude Code、Codex、Factory Droid - 成绩各异,但都漏掉同一类失败,引出 criteria drift。
2026年7月11日
7 月 10 日是 OpenAI 的大日子 - GPT 5.6 家族 Sol、Terra、Luna 三款模型落地,Codex 与 ChatGPT 桌面端合并为统一工作台,还有 Pydantic AI 2.0、Anthropic 的 GRAM 访问控制研究,以及 GitHub 关于 Copilot 代码审查退化的复盘。
2026年7月10日
OpenAI 正式发布 GPT-5.6 系列,包含 Sol、Terra、Luna 三个尺寸 - 不是单一大模型,而是一个从效率到性能完整覆盖的家族。同日还有 ChatGPT Work、GPT-5.6 进入 M365 Copilot、GPT-Live 语音升级,以及 ARC-AGI-3 上 7.8% 成绩引发的争议。
2026年7月9日
OpenAI 发表 audit 报告《Separating signal from noise in coding evaluations》,把业界常用的编程评测集 SWE-Bench Pro 翻箱倒柜查了一遍,结论有点尴尬 - 大约 30% 的题目是坏的。围绕智能体评估,harness 工程化成了新的关注点。
2026年7月8日
腾讯正式发布 295B 参数的 MoE 开源模型 Hy3;微软在 Excel 和 Word 里悄悄用自研 MAI 模型替换 OpenAI 和 Anthropic;SWE-Marathon 在十亿 token 尺度上评估编程 Agent;Alignment Forum 的研究发现数据筛选对 SFT 行为的影响远小于预期。
2026年7月7日
Addy Osmani 发布了一套衡量 Agent 自主性的双轴框架;AWS 把 MiniMax 的智能体原生模型放上 Bedrock;Hugging Face 的 LeRobot v0.6.0 给机器人学习加上了世界模型和奖励模型。三条线拼出同一幅画面。