逐字转录 → 识别口误 → 删词清单 → 物理剪切 → 字幕重建
把口播原片自动转成逐字稿,标出语气词、重复、卡顿和口误,审核后执行精准剪切,并重建对齐字幕。
- 转录逐字稿,按词对齐时间轴
- 识别语气词、重复、卡顿、口误并给出置信度
- 审核删词清单,逐项标记删除或保留
- 执行物理剪切,保持画面与音频同步
- 重建字幕并检查音画错位
口播、字幕、取片、调色、虚拟人、成片验收 · 共 20 个可复用技能
逐字转录 → 识别口误 → 删词清单 → 物理剪切 → 字幕重建
把口播原片自动转成逐字稿,标出语气词、重复、卡顿和口误,审核后执行精准剪切,并重建对齐字幕。
分镜 → 动画 → 总时间线 → 导出与验收
在粗剪基础上补齐分镜、动画与总时间线,输出带字幕、封面和转场的完整成片 final.mp4。
断句 → 校对 → 样式 → 防遮挡
对自动转写结果做断句、纠错和样式优化,统一字数、时长与安全区,避免遮挡人脸或关键信息。
SRT 圈选 → 匹配脚本文案 → EDL/CSV 交付
把长素材按 SRT 与脚本文案自动圈出对应片段,导出 EDL、CSV 或分段字幕,交给精剪软件直接对位。
抖音/小红书/B站/视频号一键参数
按目标平台自动匹配分辨率、帧率、码率、字幕字号与封面比例,减少导出翻车和二次转码。
情绪线分析 → 5 条一分钟脚本 → BGM 定位
从完整视频或 SRT 里拆出情绪高点,按爆款公式生成 5 条一分钟切片脚本,并标注卡点与 BGM。
文案 → 数字人素材 → 配音 → 字幕封面成片
用数字人形象配合声音克隆,把文案批量做成口播视频,适合无需真人出镜的账号矩阵。
口播 + 屏幕画面 → 竖屏教程
把纯口播转成“人像小窗 + 屏幕演示”的教程视频,自动框选重点并控制节奏。
口播视频 → 小红书图文笔记
把视频内容提炼成小红书图文:标题、正文、标签、配图建议,一条素材多次分发。
风格定调 → LUT 选择 → 肤色/氛围
根据题材建立调色方向,选择合适的 LUT 与节点,统一肤色、影调与情绪氛围。
人声分离 → 降噪 → 去口水音 → 响度
对人声做分离、降噪、去口水音和响度标准化,让口播听感干净且符合平台响度标准。
匹配剪辑 → 无缝转场 → 节奏卡点
根据素材运动、构图和音乐节奏设计转场,让段落切换自然且有冲击力。
标题字 → 缩略图 → 3:4 封面
用 AI 生成与排版封面标题,按平台比例输出高点击率缩略图。
音画同步 → 字幕溢出 → 黑帧 → 平台合规
按检查清单验收成片,自动发现音画错位、字幕溢出、黑帧、静音段和平台合规问题。
代理 → 打点 → 命名 → 粗筛
建立可复用的素材库规范:代理文件、关键词打点、统一命名和粗筛,让长项目不迷路。
关键词归组 → 金句开头 → 节奏切分
按主题和关键词把素材归组,用金句开头、鼓点切分和统一转场做成混剪合集。
多机位同步 → 机位切换 → 人名条 → 问答结构
把多机位访谈快速同步对齐,按说话人和问答结构切换机位,自动生成人名条与对话字幕,适合播客、采访和圆桌内容。
关键词提取 → 素材匹配 → 补画面 → 节奏控制
从口播或讲解词里提取画面关键词,自动匹配 B-roll 素材,补齐空镜和演示画面,让成片不再是一张大脸。
音乐层级 → 音效点缀 → 环境声 → 混音交付
为成片搭建完整声音层级:BGM 情绪曲线、关键音效、环境声和响度统一,让画面节奏被声音托住。
数据导出 → 完播分析 → 标题切片优化 → 下期选题
把播放、完播、点赞和留存数据转成剪辑决策:哪里改钩子、哪里改节奏、哪条该做切片,让下一次剪辑有据可依。
关于 Skill 的边界、上手顺序和工具要求。
都不是。Skill 是一套可复用的“人 + AI + 工具”流程:输入什么素材、按什么顺序处理、在哪里加人工审核、交付什么文件。它不依赖某一个软件,换成剪映、Premiere 或 Final Cut 都能落地。
建议先跑口播智能粗剪:它只处理你已有的素材,风险低、见效快。跑通转录、口误标记、删词审核、字幕重建四步后,再进口播成片和平台配方。
不需要。转录可以用免费额度,字幕可以用剪映和免费字幕工具,调色可以先用 DaVinci Resolve 免费版。付费工具解决的是批量、质量和协作问题,不是入门问题。
先选一条真实要交付的视频,把对应 Skill 的步骤完整跑一遍,记录卡点;跑通后再把高频动作固化成自己的模板和提示词,最后才谈批量和自动化。