LLM

17 篇文章

2026年7月13日

【AI早读 0713】语义盲点、Agent 评估与 AI 前沿

AI Engineer 频道集中发了一批高质量 talk - Phaidra 的 50 万传感器让 LLM 陷入语义盲点、微软 Pablo Castro 谈 AI 知识系统的检索与理解之别、Alignment Forum 上让模型通过独立推理形成道德判断的训练流程,还有 eBay 给每个 PR 打分的 ReviewDebt 框架。主线是从让 AI 跑起来转向让 AI 可靠地跑起来。

2026年7月12日

【AI早读 0712】自动化评估能替代人工判断吗

Hamel Husain 和 Antaripa Saha 拿 100 条真实生产 trace、39 个已知失败,横评了 Braintrust、Arize、LangSmith 三个评估平台和 Claude Code、Codex、Factory Droid 三个通用 coding agent - 成绩各有高低,但所有系统都漏掉了同一类 failure,引出 criteria drift 与人在回路的评估方法。