
镜语 Agent
目录
核心功能
- **一键成片 — **从主题到最终 MP4,一条命令搞定分镜、配图、配音、字幕、配乐
- **交互式策划 — **生成前先对方案,画幅、时长、风格、结局走向都能调
- **情绪配乐 — **LLM 判断故事情绪,自动从素材库匹配 BGM
- **三件套输出 — **字幕烧录版、干净无字幕版、SRT 字幕文件,不支持无损导入剪映调整
项目简介
该agent支持用户给出一个主题,直接产出一条可发布的短视频。分镜脚本、配图、配音、字幕时间轴、镜头转场、背景音乐全部自动化完成,使用者全程只需要输入主题文字,再完成少量选项确认,实现视频产出物的自动化生产。
本agent将分散在多款工具中的操作整合为完整流水线,让创作者把精力聚焦在选题与内容构思上,不用耗费大量时间重复处理后期机械拼接工作。
痛点问题
- 创作精力大量消耗在脚本拆分、素材查找、音字幕对齐等重复性琐事,而非核心内容创意
- 多款独立工具割裂,流程需要人工手动衔接,无法形成完整流水线
- 科普类视频难以搜集风格统一的示意图、信息图等配套素材
- 配音、字幕时序校准、画面合成、配乐调试等工序步骤繁琐,耗时漫长
产品亮点
全链路自动衔接
用户直接输入主题即可启动从脚本构思、素材生成、配音合成到视频剪辑的完整流程。各环节数据自动流转,彻底打破工具壁垒,无需人工干预和素材搬运。
生成前交互确认
在视频正式渲染前,提供脚本大纲和分镜文案的预览界面。用户可直接在线修改,确保内容准确无误后再执行渲染,有效避免成品返工,显著节省算力成本。
本地 ffmpeg 合成
视频的最终合成、转场特效和字幕烧录均在本地通过 FFmpeg 完成。这不仅能充分利用本地硬件资源,实现更快的渲染速度和更稳定的输出效果,还支持动态缩放、渐变转场等多种视觉效果,让静态画面更生动。
断点续跑缓存
系统具备智能缓存功能,会自动保存已完成的中间环节结果。当任务因网络波动或 API 调用不稳定而中断时,重启后可从断点处继续执行,无需从头开始,极大提升了生产流程的健壮性和容错能力。
业务流程
**步骤 1:**用户输入主题(如“耳屎到底该不该掏”),系统进入交互式策划环节,镜语agent会通过对话的方式和用户进行需求的讨论,保证产出符合用户需求
**步骤 2:**用户选择画幅(竖屏/横屏)、时长、风格等参数,或直接使用默认值
**步骤 3:**系统用一次 LLM 调用生成完整故事大纲,包含标题、梗概和逐条分镜旁白
**步骤 4:**用户审阅分镜内容,可直接编辑旁白文案,确认后进入生成阶段
**步骤 5:**每个分镜并行执行:文生图生成画面 → TTS 合成旁白音频 → ffmpeg 合成单段视频(此处需对接文生图、TTS模型)
**步骤 6:**所有片段完成后,按顺序拼接为完整视频,相邻片段间加 xfade 淡入淡出转场
**步骤 7:**从已知文本和音频时长生成本地 SRT 字幕文件
**步骤 8:**将字幕烧录进视频,同时输出无字幕干净版
**步骤 9:**LLM 根据故事内容判断情绪标签,从素材库(用户自定义)自动匹配 BGM 并混音
**步骤 10:**最终输出三件套:字幕烧录版 MP4、无字幕版 MP4、SRT 字幕文件
成品展示


商业化落地思考
目标用户有两类。一类是个人创作者和自媒体运营者,他们需要高频产出短视频但团队人手有限,一类是内容公司,有批量生产需求但想在脚本创意上保留人工把关。
商业模式上,个人用户走订阅制,按月或按生成条数收费,核心卖点是把一条视频的生产时间从几小时压到几分钟。机构用户走 API 接入或者私有化部署,把这条流水线嵌进他们自己的内容生产系统。这个模式现在可行的原因是,底层的大模型 API 成本已经降到了单条视频几毛钱的水平,加上本地 ffmpeg 不占云资源,边际成本很低。
未来迭代路径
一是接入图生视频模型,让每个分镜从静态图变成几秒的动态视频,画面表现力会有质的提升。二是做一个 Web 界面,把 CLI 的交互搬到浏览器里,降低使用门槛,让非技术用户也能直接上手。