先算一笔账
一条 10 分钟口播,手动找口误和重听素材通常要 2-3 小时;转录、粗剪、字幕再各占一截。把流程拆成转录、标记、剪切、字幕、导出五步后,AI 主要负责前三步的重复劳动,人只做审核。
转录和标记
先用语音识别生成逐字稿,再让模型按语气词、重复、卡顿、口误四类标记问题。重点不是让 AI 直接删,而是让每一处删除都有时间点和置信度,人工扫一眼就能决定。
剪切与字幕
确认删词清单后执行物理剪切,字幕跟着时间轴重建。这里最忌讳只删音频不删画面,或者删完不做音画对位检查。
落地清单
素材进项目先统一命名;转录后先出问题清单;删除前逐条确认;字幕重建后检查遮挡;导出前按平台配方过一遍参数。