国哥来了·开源工具手记2026.08.19

一段普通口播,如何变成动画视频?

我把完整方法开源了:从内容理解、人物避让到横竖屏交付。

AGENT SKILL

拍完口播只是开始,真正费时间的是后面的包装与返工。

开源 Agent Skill动画视频总控

EDITOR'S NOTE

开场

拍完一条口播,往往只是开始。真正耗时间的,是后面的字幕、配图、截图、动画、图表、横竖屏适配,以及一遍又一遍的检查和返工。

如果是一个人做,要在文案、拍摄、剪辑、找素材、做动画之间来回切换;如果交给助理,又需要把自己的判断拆成很多步骤。真正麻烦的,常常不是缺某个工具,而是没有一个角色把所有工具和步骤统筹起来。

这段时间,我把自己实际测试的一套流程整理成了一个开源 Agent Skill:animated-video-workflow,中文可以叫它“动画视频总控”。

它不是一个新的剪辑软件,也不是只能替换文字和图片的固定模板。它更像是装在 Codex 或其他 Agent 里的视频制作总控流程:先理解内容,再安排人物、动画和素材,先做试片,确认后再完成全片。

现在,我把它放到了 GitHub,采用 MIT 许可证开源。

你可以从中拿到三样东西:公开的源码、一套可复用的视频制作流程,以及可以直接复制给 Agent 的安装和使用提示词。

动画视频总控 Skill 总览图

01

PART

先别讲功能,先看同一条视频的前后变化

同一段声音·同一段内容·相同总时长

为了验证这套流程,我用一段 52.23 秒的《纳瓦尔宝典》真人口播做了完整测试。

包装前后使用的是同一段声音、同一段内容和相同总时长,区别主要来自画面的重新组织。

包装前

信息主要依靠语言表达

vs

包装后

真人信任感与视觉解释并存

CASE A

包装前:原始真人口播

ORIGINAL · 52.23 秒

原片我只是让ai给我随便出一个书单推荐的短视频文案,我就直接OBS录制保存,其他啥也没做。画面以真人口播为主,视觉上可以看下面视频,没有任何信息,都是黑屏。

包装前原始真人口播,52.23 秒

CASE B

包装后:动画包装成片

ANIMATED · 52.23 秒

包装后保留了真人带来的信任感,同时在重点段落加入标题动画、人物素材、书封和信息图表。动画区域会根据人物位置安排,让内容更容易被看懂和记住,其实这是第一版的效果,我就直接保存了,后面优化低版本是把整个特效往左移动了一些,但是我不想等她再包装一遍,就没有生成,不过现在看,已经很厉害了,一次性输出,一刀未动。

包装后完整动画成片,52.23 秒

这次处理并不是给视频套一个固定模板,而是依次完成了内容分析、人物位置判断、分镜规划、素材组织、代表性试片、全片渲染和成片检查。

画面的作用也不是单纯“显得更炫”,而是在需要解释和强调的地方切入视觉内容,帮助观众更快抓住重点。

案例中的 纳瓦尔人物图采用 CC BY 3.0 许可并保留署名;书封画面仅用于本次演示,正式公开或商业发布前仍需确认相应使用权限。

02

PART

为什么需要一个“动画视频总控”

工具越多,越需要统一的判断顺序

口播包装不是“加一点动画”,而是一连串相互影响的判断:哪里保留真人、动画如何避开人物、缺少素材时先搜索还是生成、横竖屏如何分别构图,以及什么时候先看试片。

如果这些判断没有顺序,工具越多,流程反而越乱。这个 Skill 的价值,是把它们变成一套可以检查、确认和复用的工作流。

03

PART

它具体怎么工作

从输入检查到双画幅交付

检查输入与时间轴:

支持真人视频、配音、SRT 和文稿;只有明确要求时才先粗剪。

分析人物与安全区:

按镜头采样人物活动范围,为字幕、动画和图表安排位置。

编排视觉素材:

先用用户素材,再搜索图片、视频或网页截图,仍缺失时才生成,并登记外部来源。

选择制作引擎:

根据项目和本机能力,在原视频、HyperFrames、Remotion 与 FFmpeg 之间选择。

适配横竖屏:

共享内容和时间轴,分别设计 16:9 与 9:16 构图,不做简单居中裁切。

输入素材、制作能力与交付物示意图

04

PART

使用者最后能获得什么

方案·试片·成片·来源与质检记录

一套典型项目可以交付:

  • 动画分镜与素材方案

  • 2~3 个代表性试片

  • 16:9 横屏成片

  • 9:16 竖屏成片

  • 外部素材来源记录

  • 版权待审核清单

  • 渲染与质检结果

它适合口播知识内容、课程讲解和商业 IP,也方便个人、助理、团队或工作室按统一流程执行和验收。

从素材检查到横竖屏交付的流程图

05

PART

不会编程,怎么安装

把仓库链接直接交给 Agent

最简单的方式,不是自己下载文件,也不是打开终端敲命令,而是把仓库链接直接交给你的 Agent。

打开 Codex、Claude Code、Cursor、OpenCode,或者其他能够安装 Agent Skill 的工具,把下面整段发给它:

prompt

请帮我安装这个 Agent Skill,并在安装后验证它是否可用:

https://github.com/mrsanguo/animated-video-workflow

安装过程中,Agent 可能会询问是否允许访问网络、下载公开仓库、写入 Skills 目录或安装必要依赖。确认这是你刚刚发起的操作后,再点击允许。

正常安装这个公开仓库,不需要把 GitHub 密码、Token 或验证码交给任何人。

一句话安装步骤图

06

PART

第一次使用,我更建议半自动

先看方案·再看试片·最后渲染全片

安装完成后,把真人视频、音频、SRT 或文稿交给 Agent,再发送:

prompt

请使用 animated-video-workflow 处理我提供的素材。

使用半自动模式:

1. 先检查素材并告诉我是否缺少必要文件;

2. 先识别人脸和人物活动范围,不要让字幕、动画和图表遮挡人物;

3. 先输出分镜和素材方案,等我确认;

4. 先制作 2~3 段代表性试片,等我确认;

5. 确认后再渲染全片;

6. 同时输出 16:9 横屏版和 9:16 竖屏版;

7. 不要覆盖我的原始素材。

我不建议第一次使用时一上来就渲染完整视频。

先看分镜,再看 2~3 个有代表性的片段。人物有没有被挡住、字幕是否清楚、素材是否准确、节奏是否合适,这些问题在试片阶段解决,返工成本最低。

等风格和模板稳定后,再切换到全自动模式处理相似内容。

07

PART

开源不等于没有使用边界

源码开放,但依赖与素材仍有各自规则

这套 Skill 的源码采用 MIT 许可证开源,但它调用的模型、渲染工具、搜索服务和外部素材,仍然可能有各自的费用、许可和使用规则。

当前的人物跟踪属于“镜头级采样检测”,主要用于让动画避开常见口播人物,并不是逐帧抠像。低置信度、多人画面和未知构图,仍然应该人工确认。

本机通常需要 Python 3.10 以上、FFmpeg 和 ffprobe;人物检测会用到 OpenCV。HyperFrames 和 Remotion 是可选引擎,不是每台电脑都必须安装。依赖不齐时,可以让 Agent 自动检查和补齐,但它可能会要求你确认系统权限。

我更愿意把它看成一个持续迭代的开源起点,而不是一个已经解决所有视频问题的“万能按钮”。

///

END

写在最后

FROM CHAT TO WORK

说实话,我做这个 Skill,不是为了再造一个看起来很厉害的“万能按钮”。我只是想把那些拍完视频以后,最磨人、最靠经验、也最容易反复返工的事情,一点点交给 Agent。

当一个小白只需要给出素材、说清楚自己想要什么,剩下的识别人、找素材、做试片和适配横竖屏,都能被一套流程接住,AI 才算真正从“会聊天”走到了“能干活”。

想试的话,直接把这篇文章丢给你的 Codex 或其他 Agent,让它安装文中的 Skill 并验证是否可用。你不用研究命令,下载、安装和检查都交给它。

我是国哥,持续分享 AI 工具、内容生产和可以真正落地的自动化实践。

如果这篇内容对你有用,欢迎点赞、在看、转发三连。你们的支持,会让我继续分享更多能直接拿来用的 AI 工具和工作流。

在看

转发

THANKS FOR READING

Logo

葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。

更多推荐