2026年7月19日
【AI早读 0719】推理开销可控与 Agent 基建渐趋成熟
GPT-5.6 之后推理开销可控成为焦点 - Sebastian Raschka 拆解「低-中-高」推理模式的训练与推理机制;AI Engineer 峰会多个 talk 不约而同指向 Agent 真正缺的是收据、领域知识与特征开关;还有一篇讨论用「预测评判者判断」重做概念能力基准测试。
2026年7月19日
GPT-5.6 之后推理开销可控成为焦点 - Sebastian Raschka 拆解「低-中-高」推理模式的训练与推理机制;AI Engineer 峰会多个 talk 不约而同指向 Agent 真正缺的是收据、领域知识与特征开关;还有一篇讨论用「预测评判者判断」重做概念能力基准测试。
2026年7月18日
昨天 AI 圈最大的新闻是 Moonshot 发布 Kimi K3 - 2.8 万亿参数的开源 frontier 模型,登顶前端代码竞技场、以 76% 胜率超过 Claude Fable 5,另有 Managed Agent 不暴露 GitHub token 的安全方案。
2026年7月17日
昨天是开源大日子 - Thinking Machines 发布首个基座模型 Inkling(975B MoE,Apache 2.0),Moonshot 放出 2.8 万亿参数的 Kimi K3,Grok 4.3 首次登陆 Amazon Bedrock,Nemotron 3 Embed 登顶 RTEB。
2026年7月13日
AI Engineer 频道集中发了一批高质量 talk - Phaidra 的 50 万传感器让 LLM 陷入语义盲点、微软 Pablo Castro 谈检索与理解之别、Alignment Forum 让模型独立推理形成道德判断,还有 eBay 给每个 PR 打分的 ReviewDebt。
2026年7月12日
Hamel Husain 和 Antaripa Saha 拿 100 条真实生产 trace、39 个已知失败,横评 Braintrust、Arize、LangSmith 与 Claude Code、Codex、Factory Droid - 成绩各异,但都漏掉同一类失败,引出 criteria drift。
2026年6月21日
Google DeepMind 对 DiffusionGemma 展开透明度审计,发现扩散语言模型的中间变量仍可解释,但非时序推理让算法透明度更具挑战;AlphaFold 创造者 John Jumper 离开 DeepMind 加入 Anthropic;Codex 则新增从一次操作演示中学习并重复执行工作流的能力。
2026年6月19日
GLM-5.2 以 753B MoE、百万 token 上下文和 IndexShare 稀疏注意力机制登顶开放权重模型;Google DeepMind 发布 AI Control 路线图,Amazon Bedrock AgentCore 正式 GA,智能体安全与运行基础设施同步加速。
2026年6月6日
把 Mistral Small 这样的生成式小模型,改造成能同时打多个情感标签的分类器。真正的工作量不在微调本身,而在 GoEmotions 那份严重倾斜的标注数据上。
2026年5月16日
今天聚焦 LLM 架构、预训练稳定性和 AI 学习边界:Sebastian Raschka 梳理长上下文效率相关的新架构,Dwarkesh Patel 总结打破因果性与引入偏置如何导致训练失败,同时讨论强化学习与人类学习之间不能被忽视的差异。
2026年5月6日
OpenAI 把 ChatGPT 默认模型升到 GPT-5.5 Instant,发布页只讲了三件事 - 幻觉减半、回答更短、记忆更聪明;但翻一下官方 System Card 会发现第四件 - 这是第一次让默认 Instant 模型跨过 High capability 门槛。
2026年4月16日
Anthropic 今天发布 Opus 4.7。价格没变、上下文没变,但 SWE-bench Pro 涨了差不多 11 个百分点,第一次支持高分辨率看图,指令遵循也更严格。对开发者来说,这是一次值得立刻换的免费升级。
2026年3月26日
三大 AI 模型各有什么强项?中文能力谁最好?写代码谁最强?这篇给你一个实用的选择框架。
2026年3月20日
MCP 是 AI 应用的 USB-C 接口。一文搞懂它是什么、为什么需要它、以及怎么用起来。
2026年1月29日
深入剖析 Moltbot 如何用 Markdown 文件作为记忆源、SQLite 作为检索缓存,实现透明、可编辑、可迁移的 AI 长期记忆系统。
2025年3月24日
DeepSeek 悄然发布 v3 0324 更新,模型参数规模达 685B,在编程和前端设计方面表现亮眼。本文通过 80 年代风格计时器组件、开源项目网页等实测例子,展示它在代码生成与前端设计上的能力。
2025年2月5日
本文是Andrej Karpathy的视频 Deep dive into LLMs 的笔记
2025年1月29日
机器学习量化入门:把模型权重从 FP32 等高精度降到 INT8、INT4,减少内存占用、加快推理、降低功耗。本文梳理量化的目的、原理、常见精度格式,以及在信号处理、无线通信、控制系统等领域的应用。
2025年1月27日
探索模型蒸馏技术如何实现大型模型向小型模型的知识迁移,以及在实际应用中的重要价值。
2025年1月26日
探索DeepSeek团队在大语言模型推理能力提升方面的创新方案,包括纯强化学习的R1-Zero和结合冷启动的R1模型。