返回博客2026年7月28日1 分钟阅读

我开源了让 AI 做好视频的 Skill - 视频,封面,文案,博客,统统搞定

摘要

HyperFrames 官方 Skill 把画面和渲染都办好了,可一个人做内容,交付的从来不只是一个 mp4。我把封面、文案、博客、推文,还有自己录音这条路,编排成了一个架在官方之上的 Skill,也在这里分享给同样一个人做内容的你。

我是小木头。这篇想和你分享我近期在用的一个做视频的 Skill - verysmallwoods-video,它已经开源了:https://github.com/sugarforever/boring-video-studio/tree/main/skills_v2/verysmallwoods-video

顺带说一句,下面这期视频就是用这个 Skill 做出来的,视频版在这里 👇

先抛一个问题:HyperFrames 官方已经有一套很完善的视频制作 Skill 了,那作为内容创作者,我直接拿来用,难道不够吗?

官方 Skill 已经很完善,直接拿来用够吗?

先说我是怎么做视频的

我不出镜,画面全部用 HyperFrames 生成。你可以把它理解成「用 HTML 写视频」 - 一帧就是一屏,Agent 帮我一帧一帧搭出来,再渲染成片。

用 HTML 写视频:一段 HTML 对应一段画面

官方的 Skill 已经很成熟。比如 hyperframes 这个核心入口,还有 faceless-explainer - 一篇文章或一个主题进去,一段讲解视频出来,画面、渲染,全都替我办好了。

按说这已经很够用了。可我一期一期做下来,发现有两个地方,光靠这套官方流程还不够,没法完全自动地帮我把事情做完。而恰恰是这两个地方,促使我自己写了一个 Skill 去补。下面就聊聊这两个缺口。

缺口一 - 一期视频不只是一个 mp4

第一个缺口是:出片,只是一个人做内容的其中一环。

一个人做内容,要交付的从来不只是一个 mp4。一期视频要能发出去,我还得配一张封面 - 而且通常是五种比例,横版给 YouTube 和 B 站,竖版给抖音和视频号;还要写两套平台文案,YouTube 一套、Bilibili 一套,主题内容相同,但完整描述的版式和侧重并不一样;如果有必要,再配一篇博客;此外,一条社交媒体的推广短文,也是可以有的。

一期 = 这一整套:封面五比例 + 两套文案 + 博客 + 推文

这些,官方的 Skill 都不管,也不该它管 - 它的职责很清晰,把画面和渲染做好。可封面、文案、博客、推广这一圈,全落回我自己身上。每一期都要手工重走一遍,是实打实的重复劳动。

缺口二 - 我想用自己的声音

第二个缺口,是旁白。

官方流程默认用 TTS 合成,很方便,我也试过用 TTS 克隆自己的声音。像是挺像的,可听多了就不太对劲 - 它念得出我的音色,却念不出真人的那点情绪起伏。哪里该顿一下、哪里放轻、哪里带着点笑意,这些是我对着稿子念的时候自然带出来的,声音克隆还差一层。一个人做内容,要的恰恰是这层真实感。

TTS 克隆声「像,但平」,真人录音差的就是这一层

所以真人亲自录制,对我不是可选项,是刚性需求。可一旦坚持自己录,新问题就来了:音频是我录的,节奏就由这一版录音说了算,不再由脚本说了算。哪句话在第几秒被念到,画面里那一处内容就得在那一刻出现。怎么把「我本人录音」这件事无缝接进 Agent 的流程里,让画面自动跟着我的声音走 - 这正是官方流程没替我解决的地方。

于是我搭了 verysmallwoods-video

为了补上这两个缺口,我搭了一个 Skill,叫 verysmallwoods-video

它不重做出片 - 视频本体照样交给 HyperFrames。它是架在官方 Skill 之上的一层编排。输入一个主题、一篇文章,或者一份口播稿,产出的是一整套能直接发的物料:成片、五比例封面、两套平台文案、博客、推文。少一样都算没做完。而且旁白这一环,它默认就留好了「我自己录」这个选项。

它其实只补三件事

相对官方那套 faceless 流程,它只补足三件事。

只补三件事:设计我来选 / 旁白自己录 / 物料补齐

一是设计由我来选。开局它会让我从一组预制风格里挑一套配色和版式,定下这一期的观感。

二是旁白多一个「自己录」的选择。想用 TTS 也行,但也可以选自己录 - 把音频和字幕给它,它来校对术语、按段切分、对齐时长,把每一帧的内容重新排到我真正念到的那个时间点上。

三是把发布物料补齐。封面、平台文案、博客、推文,一次生成到位,不用我再一个个手工做。

它是怎么冒出来的

说个有意思的:这个 Skill 不是我坐下来专门设计的,是做视频的半路上顺手整理出来的。

当时我正用官方流程做一期视频,用的还是自己录的音。做着做着就意识到 - 封面、文案、博客、对齐录音,这些我每一期都在重复做的事,完全可以交给 Agent,按一套固定流程走就好。于是就地把这层编排抽了出来,写成了现在这个 Skill。

它本身也是一次示范。SKILL.md 只有六十来行,只说明何时用、开局问什么、交付什么,细节都下沉到 references,用到再读;硬性规则只留最关键的几条,剩下的交给模型自己判断,不为每件小事写规矩。这也是我近期分享过的,在 Claude 5 新模型上,上下文工程的新规则的一次落地 - 与其把什么都塞进主文件,不如留白,让模型按需去取。

想自己用它 - 依赖与安装

如果你也想上手,说一下它的依赖和用法。

它是站在 HyperFrames 官方 Skill 的肩膀上的:视频本体交给核心入口 hyperframes,以及负责出片的 faceless-explainer;取音频、图片、logo 这些,交给 media-use。这几个官方 Skill,用一行命令指向 HyperFrames 仓库就装好:

npx skills add heygen-com/hyperframes

我这层编排本身也开源在 GitHub,同样一条命令装进去:

npx skills add https://github.com/sugarforever/boring-video-studio/tree/main/skills_v2/verysmallwoods-video

装好之后,在 Claude Code 里调用 verysmallwoods-video,给它一个主题、一篇文章,或者一份口播稿。它开局会先问你两件事 - 用哪套设计、旁白是自己录还是走 TTS,然后就照着交付清单,把整套物料一次交到你手上。过程中它可能还会问你几个问题来澄清需求,这也是为了帮你把一整套物料生成到位。

一点小结

回到开头那个问题:官方 Skill 已经很完善,直接拿来用够不够?

对我来说,答案是不够 - 不是它不好,而是它把视频做出来之后,还有一整套发布物料、还有我坚持要用的真人录音,得我自己来补。官方帮我把画面做好,我这个 Skill 负责把剩下这一圈补齐,并且让我的声音无缝接进整个流程。我不想每一期都手工重走一遍,就把这些交给 Agent,让它按我的习惯,一次把整套物料交到我手上。

我把它开源了,链接在下面。如果你也是一个人做内容,希望它能给你一点参考。用的过程中有任何问题,也欢迎在 GitHub 提 issue,我会尽快处理。

相关文章

2026年7月19日

grill-me:让 AI 反过来拷问你

我们让 AI 写东西,常常是它还没搞明白你要什么就动手,结果返工。Matt Pocock 那个 17 万星 skills 仓库里最受欢迎的 grill-me 把这件事掉了个头 - 让 AI 在动手之前,先一个问题一个问题地把你拷问一遍。这篇聊聊它是什么、原理、怎么装,再拿我自己两次真实使用走一遍。

最近一封 · Sample

Claude 5 时代,上下文工程的新规则 - Anthropic 为什么删掉了 80% 的系统提示词

Anthropic 的 Claude Code 团队复盘了 Claude 5 时代的上下文工程新规则:他们把系统提示词删掉 80% 以上,编码评测却没有可测的下降。这篇读完来分享六组“过去 → 现在”的变化,以及我照着新规则改自己开源 Skills 的两处实践。

—— william

Letters

来信

里面装的是

  • 新文章 — 写完一篇就寄一封,不攒货
  • 这周读到的、看到的、好用的工具
  • 正在折腾的实验,附带翻车记录

约莫 1–2 周一封 · 随时退订

合作伙伴

CompeteMap — 英国及爱尔兰学生竞赛一站式搜索

数学、编程、科学、写作等各类竞赛信息汇总,支持按年龄和科目筛选,再也不错过报名截止日。

准备开始了吗?

先简单说明目标,我会给出最合适的沟通方式。