核心观察
-
01
文件转写支持 85+ locale 的自动识别、说话人区分、逐词时间戳和最多 1,000 个自定义词条;官方同时提示,实际词表通常以较小规模更容易获得稳定结果。
-
02
逐词时间戳与说话人区分适合把审片意见定位到时间范围,但模型时间戳不是原始时间码,仍需用剪辑时间线或镜头帧号做二次映射。
-
03
Smart transcription 会删除口头停顿并重排格式,不适合需要逐字证据的场景;正式字幕、合同台词、片名和人名必须人工校对。
-
04
客户录音和未公开项目素材上传云端前,要确认保密条款、数据地区、保留策略和账号权限。
后期团队可直接利用的环节
审片会议可以输出说话人、文字和词级时间范围,再通过镜头清单把意见关联到 shot、version 和 frame range。采访与纪录片素材可先建立可搜索文本,辅助剪辑查找内容和制作字幕初稿。
建议保留原始音频、verbatim 结果、人工修订版和最终发布版四层记录,不让智能清理后的文本覆盖原始说法。
与 Nuke / Shot Atlas 的衔接思路
将转写结果规范为 JSON 或 CSV:project、shot、version、speaker、start、end、text、reviewer、status。Nuke 侧可读取批准后的帧范围生成节点注释或 Viewer 标记,Shot Atlas 一类镜头管理工具则可用于反馈检索与任务分配。
自动化只负责整理和定位,不能自动执行删除节点、覆盖版本或改变交付状态。所有写入动作应经过预览与人工确认。

