2026年7月15日
【AI早读 0715】Agent 从实验走向生产的基础设施建设
过去 24 小时的信号都指向 Agent 从演示走向生产 - Context Layer 被点名为缺失的基础设施层,Martin Fowler 网站主张用 DSL 约束 LLM 输出,而 Codex 半年内用户从 70 万涨到 700 万。
博客
记录 AI 系统、产品思考与创作者工作流的实践。
2026年7月15日
过去 24 小时的信号都指向 Agent 从演示走向生产 - Context Layer 被点名为缺失的基础设施层,Martin Fowler 网站主张用 DSL 约束 LLM 输出,而 Codex 半年内用户从 70 万涨到 700 万。
2026年7月14日
7 月 13 日 AI 圈的关键词是生产级基础设施 - OpenAI 的 GPT-5.6 全系登陆 Amazon Bedrock,Vercel 生产指数揭示开源模型 token 占比逼近三成,AWS 拿出多租户代理的 OBO 身份方案,Google Cloud 开源 k8s-aibom。
2026年7月13日
AI Engineer 频道集中发了一批高质量 talk - Phaidra 的 50 万传感器让 LLM 陷入语义盲点、微软 Pablo Castro 谈检索与理解之别、Alignment Forum 让模型独立推理形成道德判断,还有 eBay 给每个 PR 打分的 ReviewDebt。
2026年7月12日
Hamel Husain 和 Antaripa Saha 拿 100 条真实生产 trace、39 个已知失败,横评 Braintrust、Arize、LangSmith 与 Claude Code、Codex、Factory Droid - 成绩各异,但都漏掉同一类失败,引出 criteria drift。
2026年7月11日
7 月 10 日是 OpenAI 的大日子 - GPT 5.6 家族 Sol、Terra、Luna 三款模型落地,Codex 与 ChatGPT 桌面端合并为统一工作台,还有 Pydantic AI 2.0、Anthropic 的 GRAM 访问控制研究,以及 GitHub 关于 Copilot 代码审查退化的复盘。
2026年7月10日
OpenAI 正式发布 GPT-5.6 系列,包含 Sol、Terra、Luna 三个尺寸 - 不是单一大模型,而是一个从效率到性能完整覆盖的家族。同日还有 ChatGPT Work、GPT-5.6 进入 M365 Copilot、GPT-Live 语音升级,以及 ARC-AGI-3 上 7.8% 成绩引发的争议。
2026年7月9日
OpenAI 发表 audit 报告《Separating signal from noise in coding evaluations》,把业界常用的编程评测集 SWE-Bench Pro 翻箱倒柜查了一遍,结论有点尴尬 - 大约 30% 的题目是坏的。围绕智能体评估,harness 工程化成了新的关注点。
2026年7月8日
腾讯正式发布 295B 参数的 MoE 开源模型 Hy3;微软在 Excel 和 Word 里悄悄用自研 MAI 模型替换 OpenAI 和 Anthropic;SWE-Marathon 在十亿 token 尺度上评估编程 Agent;Alignment Forum 的研究发现数据筛选对 SFT 行为的影响远小于预期。