B站 公众号 淘宝店 QQ群
返回 AI 前沿实验

影视后期 AI 更新

Gemini 3.5 Transcribe:审片录音、场记与字幕进入结构化转写

Google 于 2026 年 8 月发布 Gemini 3.5 Transcribe 与实时版本,提供自动语言识别、代码切换、说话人区分、逐词时间戳、自定义词表和智能格式化。它与画面生成无关,却很适合把审片录音、采访、场记和客户反馈变成可检索的镜头级文本,再由人工确认后进入字幕、标记和制作跟踪流程。

GeminiTranscriptionDailiesSubtitleMetadata

核心观察

  • 01

    文件转写支持 85+ locale 的自动识别、说话人区分、逐词时间戳和最多 1,000 个自定义词条;官方同时提示,实际词表通常以较小规模更容易获得稳定结果。

  • 02

    逐词时间戳与说话人区分适合把审片意见定位到时间范围,但模型时间戳不是原始时间码,仍需用剪辑时间线或镜头帧号做二次映射。

  • 03

    Smart transcription 会删除口头停顿并重排格式,不适合需要逐字证据的场景;正式字幕、合同台词、片名和人名必须人工校对。

  • 04

    客户录音和未公开项目素材上传云端前,要确认保密条款、数据地区、保留策略和账号权限。

后期团队可直接利用的环节

审片会议可以输出说话人、文字和词级时间范围,再通过镜头清单把意见关联到 shot、version 和 frame range。采访与纪录片素材可先建立可搜索文本,辅助剪辑查找内容和制作字幕初稿。

建议保留原始音频、verbatim 结果、人工修订版和最终发布版四层记录,不让智能清理后的文本覆盖原始说法。

与 Nuke / Shot Atlas 的衔接思路

将转写结果规范为 JSON 或 CSV:project、shot、version、speaker、start、end、text、reviewer、status。Nuke 侧可读取批准后的帧范围生成节点注释或 Viewer 标记,Shot Atlas 一类镜头管理工具则可用于反馈检索与任务分配。

自动化只负责整理和定位,不能自动执行删除节点、覆盖版本或改变交付状态。所有写入动作应经过预览与人工确认。