镜语 Skill
输入主题即可一键成片的短视频自动化 Skill,分镜、配图、配音、字幕、配乐全链路本地 FFmpeg 合成。

一、项目简介
镜语skill是一个基于AI的抖音科普短视频生产线。用户只需输入一个主题,系统自动完成从脚本构思、分镜设计、AI配图、语音合成到视频剪辑的全流程,产出可直接发布的竖版短视频。
这条Pipline把原本分散在多款工具中的操作整合为完整流水线:LLM负责创意分镜、文生图模型生成画面、TTS合成配音、本地ffmpeg完成视频合成。创作者只需关注核心的选题,不用耗费时间处理后期机械拼接工作。
二、核心功能
- 一键成片 — 输入一个主题,自动完成分镜脚本、AI配图、TTS配音、字幕烧录、封面生成,从文字到可发布MP4全程自动化
- 交互式策划 — 生成前先对齐需求:画幅(9:16竖屏)、时长(30/60/90秒)、风格、选题角度都能调整
- 爆款方法论 — 内置13条编导铁律,总分总结构、前10秒抛钩子、相声式衔接,确保视频有“网感”
- 双角色一致性 — 固定“猴哥”主角+主题配角,跨镜形象严格锁定,杜绝换脸穿帮
- 三件套输出 — 字幕烧录版MP4、封面图、发布文案,开箱即发
三、痛点问题
- 创意精力被琐事吞噬 — 脚本拆分、素材查找、音字幕对齐等重复性工作占据大量时间,核心创意反而被挤压。
- 工具割裂效率低下 — 文案、配图、配音、剪辑分散在不同工具,人工衔接耗时费力,容易出错。
- 科普素材难统一 — 科普类视频需要风格一致的示意图、信息图,手工搜集难以保证视觉统一。
- 技术门槛高 — 配音、字幕时序校准、画面合成、配乐调试等工序繁琐,非技术用户难以独立完成。
四、产品亮点
4.1 全链路自动衔接
用户输入主题即可启动从脚本构思、素材生成、配音合成到视频剪辑的完整流程。各环节数据自动流转,彻底打破工具壁垒,无需人工干预和素材搬运。
4.2 交互式核对机制
系统采用“两轮核对”设计:先产出《脚本计划》与用户讨论定稿,再产出《分镜脚本》逐项确认。用户可直接修改文案、调整钩子策略,确保内容准确无误后再执行渲染,有效避免成品返工。
4.3 爆款方法论内置
将抖音爆款视频的编导经验固化为13条铁律:第一人称角色解说、隐喻主线贯穿、相声式衔接、前10秒密集抛钩子、总分总结构等。这些方法论写入LLM的system prompt,确保每条视频都具备“网感”。
4.4 本地ffmpeg合成
视频的最终合成、转场特效和字幕烧录均在本地通过ffmpeg完成。充分利用本地硬件资源,实现更快的渲染速度和更稳定的输出效果,支持Ken Burns缓动、渐变转场等多种视觉效果。
4.5 断点续跑缓存
系统具备智能缓存功能,自动保存已完成的中间环节结果。当任务因网络波动或API调用中断时,重启后可从断点处继续执行,无需从头开始,极大提升了生产流程的健壮性。
五、业务流程
步骤1:模型与配置引导
系统引导用户确认模型配置:火山方舟API Key(必需)、LLM模型(推荐deepseek-v4-flash)、生图模型(推荐doubao-seedream-5.0-lite)、TTS音色(默认悟空)。用户可选择默认满配或自定义配置和自定义的音色,若选择低配模型会出现效果打折的情况。
步骤2:需求澄清
用户输入主题(如“草莓根本不是水果”),系统澄清四个关键问题:主题、时长(30/60/90秒)、语气与受众、需要避开的敏感点。
步骤3:脚本计划生成
系统产出《脚本计划》:主题解读、隐喻主线(用具象事物串起知识点)、总分总骨架(钩子段+揭秘段+收束段)、配角设定(主题配角拟人名+人设)、预计时长与镜数。
步骤4:脚本计划核对
提供用户审阅脚本计划,可调整钩子策略、详略分配、语气风格。系统根据反馈修订,用户确认后才进入下一步。
步骤5:分镜脚本生成
基于定稿计划生成完整分镜:每镜包含口语化文案(≤20汉字)和画面描述。系统自动校验角色一致性(仅猴哥+配角)、禁词规则。
步骤6:分镜脚本核对
用户逐项确认分镜内容:文案口吻、画面设想、节奏安排。用户确认定稿后才进入生成阶段。
步骤7:AI并行生成
每个分镜并行执行:文生图生成画面 → TTS合成旁白音频 → ffmpeg合成单段视频。系统内置角色形象锁,确保跨镜视觉一致。
步骤8:视频合成与拼接
所有片段按顺序拼接,相邻片段间加入转场特效。生成字幕文件并烧录进视频,同时输出封面图和发布文案。
步骤9:BGM混音(可选)
系统根据故事内容判断情绪标签,从用户自备的素材库自动匹配BGM并混音(用户下载提供)。不提供BGM时照常输出无配乐版。
步骤10:交付验证
输出三件套:字幕烧录版MP4、封面图、抖音爆款发布文案。交付前人工目检:角色仅猴哥+配角、封面标题不截断、无爆音。不达标可凭缓存断点续跑局部重做。
六、成品展示
| 截图 | ![]() | ![]() |
| 视频 |
七、商业化落地思考
目标用户有两类。一类是个人创作者和自媒体运营者,他们需要高频产出短视频但团队人手有限;另一类是内容公司,有批量生产需求但想在脚本创意上保留人工把关。
商业模式上,个人用户走订阅制,按月或按生成条数收费,核心卖点是把一条视频的生产时间从几小时压到几分钟。企业用户走API接入或者私有化部署,把这条流水线嵌进他们自己的内容生产系统。
这个模式现在可行的原因是,底层的大模型API成本已经降到了单条视频几毛钱的水平,加上本地ffmpeg不占云资源,边际成本很低。爆款方法论的内置更是降低了用户的学习和构思的成本,让非专业编导也能产出有“网感”的视频内容。
八、未来迭代路径
该skill未来迭代或商业化的路径有几个思路:
1.做一个Web界面,把CLI的交互搬到浏览器里,降低使用门槛,让非技术用户也能直接上手。
2.做付费,配置好模型API,将一条视频进行包装后按视频产出量收费。
3.三是扩展角色库,除了固定的“猴哥”主角,可以增加更多IP化角色选择,满足不同风格的需求。
4.四是增加多平台适配,支持小红书、视频号等不同平台的画幅和整体调性风格要求。

