L5 创作 / 案例研究
用代码驱动的视频制作工坊
竖屏视频的制作流水线:AI 生成镜头、配音、动态字幕,以及用代码完成渲染。
开发中 · 始于 2026年5月
项目起点
这个工坊用来制作竖屏短视频,不必再回到剪辑软件里做一遍:风格只写一次,之后每条视频都可以复用。
要解决的问题
一条精致的竖屏视频——逐词字幕、数字卡片、配音——要花好几个小时手工剪辑,而传统剪辑软件很难复用同一套风格。AI 生成的镜头还会带来新的麻烦:文字无法辨认、带水印、色彩空间不兼容。
我的方案
工坊把视频当作代码来处理:用 React 编写、由数据驱动的合成,在画面之上叠加动态图层,既不改动剪辑也不改动配乐。脚本把上游步骤自动化——生成镜头、合成配音、转写文本——每一步都有文档,可以原样重跑。
- 根据自动转写生成的逐词动态字幕
- 可复用的图层:字幕条、数字卡片、徽章、标记
- 由一个数据文件驱动的 1080 × 1920 竖屏合成
- AI 生成的镜头与合成配音已接入整条流水线
- 确定性渲染,随后自动校验画面与声音
技术内幕
每条视频都走同一个流程:先准备素材,逐词转写,再把转写结果转换成数据(词、卡片、音效)。用 React 编写、逐帧渲染的 Remotion 合成读取这些数据,把图层叠加到画面上。上游由脚本驱动图像、视频和语音的生成模型;下游由 ffmpeg 负责拼接、混音和色彩空间转换。一切都以帧号为索引,因此渲染结果可复现。
值得一提的难点
把手机拍摄的 HDR 素材转成 SDR 时,自动峰值检测会让对比度在一个镜头里前后起伏——只看单帧是发现不了的。通过对比时间轴上分布的多帧定位了问题,然后把转换曲线固定下来予以修复。
我的角色
Odilon 设计了这条制作流水线,并借助 Claude Code 完成开发:合成与图层、自动化脚本、各步骤的文档、美术指导和渲染验证。
项目进展
字幕与图层流水线已经可用,能够端到端地产出视频。目前的工作是用生成的镜头替换实拍元素。
- 完成用生成镜头替换实拍元素的工作
- 把发布排期自动化
项目所用工具
- 视频渲染
- Remotion 4、React、TypeScript
- 图层
- HyperFrames、d3-geo、topojson
- AI 生成
- Veo 3.1(Google Flow)、Seedance、Nano Banana
- 合成语音
- ElevenLabs、edge-tts
- 转写
- Whisper
- 处理
- ffmpeg 与 ffprobe、Python、Node.js
- 编排
- Claude Code(专用子智能体)