返回博客2026年9月13日1 分钟阅读

Google 的 Agent 观测 Skill 为什么突然冲上热榜

摘要

Google 的 agents-cli 把 Agent 观测拆成 Trace、提示词日志、BigQuery 分析和第三方 OTel 集成。它登上 skills.sh 热榜,真正值得看的不是榜单数字,而是把“看见 Agent 做了什么”和“保存了什么数据”分开处理。

北京时间 9 月 13 日清晨,我在 skills.sh Hot 看到 Google 的 google-agents-cli-observability:榜单写作 550+273。这不是 GitHub star,也不能从这个写法推出“日增 273 stars”;它是 skills.sh 自己的热度/安装信号。详情页同一时点显示该 Skill 有 190.6K installs,而对应的 google/agents-cli 仓库是 5,917★。两个数字说的是两件事。

热榜本身不值得写一篇文章。让我停下来看的,是它刚好把一个容易被混成一句“加一下可观测性”的问题拆开了:你想知道 Agent 有没有变慢、某次工具调用为什么失败,还是想把用户提示词和模型回答长期存下来?这三件事的权限、费用和隐私后果都不同。

agents-cli 是 Google 开源的一组 CLI 与 Skills,目的是让 Claude Code、Codex 等编码 agent 能创建、评估和部署 Google Cloud 上的 Agent。它不是另一个编码 agent。仓库 README 里给出的安装入口是 uvx google-agents-cli setup,也可以单独用 npx skills add google/agents-cli 安装 Skills。README 还把本地开发与云端部署分开:本地的创建、运行和评估可以用 AI Studio API key,部署和云端能力则需要 Google Cloud。

不是一条“日志开关”

这枚 Skill 的核心不是某个 SDK 函数,而是一张四层表。第一层是 Cloud Trace:用 OpenTelemetry 记录调用链、延迟、错误、模型调用和工具执行。第二层是提示词/响应日志:把 GenAI 交互导出到 GCS、BigQuery 与 Cloud Logging。第三层是 BigQuery Agent Analytics:把模型调用、工具使用和结果变成结构化事件。第四层才是 AgentOps、Phoenix、MLflow、Weave 等第三方平台。

这种拆法看起来很普通,却刚好修正了 Agent 项目里最常见的误会。Trace 不等于“把对话全存起来”。Skill 对两条数据路径分别设置开关:

  • OTEL_INSTRUMENTATION_GENAI_CAPTURE_MESSAGE_CONTENT=NO_CONTENT 控制 trace 与事件中是否带消息内容
  • LOGS_BUCKET_NAME 配合 completion hook 则控制 GCS/BigQuery 的完整提示词和响应上传

也就是说,即使 trace 里不放内容,后者仍可能保存完整对话。这不是一个实现细节,而是上线前必须和安全、合规团队说清的事实。原始说明写得很明确:SKILL.md 的 Prompt-Response Logging 部分 将两者称为独立层级,并说明 Terraform 部署的默认行为。

先定数据边界,再选看板

Skill 建议把 Cloud Trace 当作起点。它默认启用,能回答“哪一环慢了”“工具在哪次调用报错”;对多数刚上线的 Agent,这已经足够。需要审计模型交互或排查具体回答时,才进入提示词/响应日志。只有确实要做漏斗、工具成功率、LLM-as-a-judge 等统计分析,才值得启用 BigQuery Agent Analytics。

这里有一个很实际的成本排序:越靠后,数据保留越久、权限面越大、费用也越难通过一次 trace 页面估算。把四层一次性全开,通常不是成熟,反而是把最难收回的数据先落了盘。

第三方平台也不必被当成“更高级的默认选项”。Skill 列出 Phoenix 的开源自托管、MLflow 的跟踪服务、以及 AgentOps、Arize AX、Weave、Freeplay 等 SaaS 方案,并要求在接入前先比较团队协作、可视化和 prompt 管理的需求。完整对照 的价值在于把选择权留给项目,而不是假装有一个通用最优解。

Terraform 的顺序比指标更容易出事故

文档里最不“营销”的一段反而最有用:如果目标是 Agent Runtime,agents-cli infra single-project 应当在第一次 agents-cli deploy 之前运行。原因不是命令挑剔,而是 Terraform 会管理整个 Reasoning Engine 资源;先用 SDK 部署,再让 Terraform 接手,状态会发生冲突。

已经部署过也不是只能推倒重来。Skill 给了两条路:删除原来的 SDK 部署,改为 Terraform 管理;或保留现有实例、用 agents-cli deploy --update-env-vars 更新环境变量,再手动补齐 Storage、Logging、Trace、BigQuery 所需的 IAM 角色。两种方案分别交换的是会话/在途状态和后续基础设施的一致性,不能把它简化成“开一个观测开关”。部署顺序与角色清单 都在一手文档里。

这也是它现在值得关注的原因。agents-cli 在 9 月 1 日发布的 v1.5.0 新增了扩展系统和 LangChain 模板,同时增加了查看 Terraform 配置、只更新已有部署等能力。它把“让编码 agent 写出一个 Agent”往“让团队能部署、回看和维护它”推进了一步。仓库创建于 2026 年 4 月 8 日,本轮观察时是 5,917 stars、660 forks;热榜信号和这条产品演进正好叠在一起。

如果你已经在 Google Cloud 跑 ADK Agent,可以先只验证 Cloud Trace 是否能看见一次完整调用,再决定是否让任何提示词内容离开运行环境。若你只是用 Codex 或 Claude Code 在本地做原型,这套 Skill 同样可以当成上线前检查表来读,但不需要为了“可观测”先引入 BigQuery 与一串 IAM 权限。


相关文章

最近一封 · Sample

OpenRig 冲上 Trending:把 Claude Code 和 Codex 编成一支队伍

“OpenRig 在 GitHub Trending Today 获得 622 个 stars 的窗口信号。它用可恢复的队列、席位与权限记录,把 Claude Code 和 Codex 放进同一套多 Agent 工程流程。”

—— william

Letters

来信

里面装的是

  • 新文章 — 写完一篇就寄一封,不攒货
  • 这周读到的、看到的、好用的工具
  • 正在折腾的实验,附带翻车记录

约莫 1–2 周一封 · 随时退订

合作伙伴

CompeteMap — 英国及爱尔兰学生竞赛一站式搜索

数学、编程、科学、写作等各类竞赛信息汇总,支持按年龄和科目筛选,再也不错过报名截止日。

准备开始了吗?

先简单说明目标,我会给出最合适的沟通方式。