精选理由
这个 Skill 把专业动画导演的制片流程封装成了 Agent 可执行的管道,首段锚定人声、风格图贯穿全片,工程化地解决了角色崩和声音飘的问题,个人创作者 40 块钱就能产出 2 分钟电影感科普视频,值得马上动手试。
AI 摘要
前字节产品经理 @s1dashu 开源 animated-voiceover,一套喂给 Codex/Claude Code 的完整动画科普视频制片流程,MIT 协议,可实现 90% 自动化。
正文 · AI 翻译
这个Skill真的让我看到了一个人干翻一个动画工作室的可能性,我用它做了个DeepSeek V4-Flash的视频,
一个人,一条指令,40块钱,2分钟电影感动画科普视频。
不是那种一眼AI的垃圾。是角色不崩、声音一致、镜头有语言、旁白有节奏的正经片子。
这东西叫animated-voiceover,刚开源,MIT协议。作者是前字节产品经理@s1dashu,他自己已经用这套东西在小红书起号了。
它不是软件,不是App,是一套喂给Codex/Claude Code的完整制片流程。你就跟它说一句:"用animated-voiceover做一条两分钟关于确认偏误的动画科普",剩下的Agent按流程给你跑:
先研究,写完整旁白, 锁视觉风格参考图,锁角色参考图。 每15秒拆成5个镜头,每个镜头写清主体、变化、镜头运动。
先生成第1段,把人声提出来,48kHz立体声WAV锁死。
后面所有片段全部挂这同一个人声参考--声音飘的问题,工程化解决了。
逐段QC,旁白完整性、角色一致性、构图、运动,不合格重来。 最后拼成片,做封面。
最狠的是它解决问题的方式,全是工程思维,不是玄学。
AI视频最大的痛点是什么?声音每段都不一样,角色脸走着走着就变了,镜头之间没有逻辑。
他怎么干的?先做第一段,把人声锚定,后面全挂这个参考。
一张风格图贯穿全片,每个角色独立参考图+角色表管理。
旁白写完再切,中文卡到每15秒60个字,多一个少一个都不行,信息密度均匀,不机械。
这不是"帮我生成个视频",这是把一个专业动画导演脑子里的制片流程,变成了Agent可以执行的Skill。
一条2分钟的片子,LibTV跑下来大概40块钱。一个人,一个下午,从选题到成片。以前这活儿得一个团队干一周。
作者反复强调一句话:90%自动化,但那10%人的判断决定上限。你定选题、定风格、卡审批,剩下重复的、容易出错的、熬人的,全交给Agent。
这才是Agent Skill该有的样子,
不是跟你聊天,不是帮你写个Prompt,是把一整条专业生产管线--从研究到脚本到分镜到渲染到QC到成片--封装成一个你随时可以调用的能力。
知识博主、超级个体、想做深度内容但不会动画的人,这个东西的价值怎么强调都不过分。B站、小红书那些电影感科普号,以前得团队作战,现在一个人就能干。
GitHub搜s1dashu/animated-voiceover,SKILL.md和references目录里全是干货,旁白怎么写、分镜怎么拆、声音怎么锁、Seedance的提示词怎么用,全给你摊开了。
别再问AI能不能替代内容创作者了,会用这种工具的创作者,正在替代不会用的。
### 引用推文
> sida:最近我在用 Codex 配合 LibTV CLI 制作动画科普视频(Animated Voiceover Video),同时运营一个小红书账号。目前小红书账号正在稳步起步,数据看起来相当健康。 现在我把这个 Skill 开源出来了: https://github.com/s1dashu/animated-voiceov...
原文
Original Title
这个Skill真的让我看到了一个人干翻一个动画工作室的可能性,我用它做了个DeepSeek V4-Flash的视频, 一个人,一条指令,40块钱,2分钟电影感动画科普视频。 不是那种一眼AI的垃圾…
Source
AYi (@AYi_AInotes)
Site
x.com
Published
2026-08-01 00:01