B站 公众号 淘宝店 QQ群
返回 AI 前沿实验

视频与图像生成

Google Veo 3.1 / Imagen 4:生成媒体模型对镜头参考的价值

Google DeepMind 官方页面把 Veo 3.1 定位为视频生成模型,强调文本到视频、图像到视频、文本到音频+视频和真实物理;Imagen 4 则强调更清晰的图像、速度和文字渲染改进。两者都适合做镜头参考与前期探索,但仍需要回到 Nuke 做最终画面检查。

Veo 3.1Imagen 4Google DeepMindReference

核心观察

  • 01

    Veo 3.1 这类视频模型适合快速测试镜头运动、氛围、节奏和声画参考,但生成结果不能直接跳过合成检查。

  • 02

    Imagen 4 的清晰度、风格和文字渲染能力适合概念图、质感参考、道具/背景探索和 matte painting 前期方向。

  • 03

    使用 Google 模型时要同时查看 model cards、可用渠道和安全限制,避免把演示能力误解成生产承诺。

适合后期的使用方式

在后期流程里,Veo / Imagen 更适合作为导演沟通、镜头概念、动态参考、B-roll 想法和局部素材探索,而不是直接替代 Nuke 合成链路。

如果生成结果要落到镜头里,应把它拆成可控素材:静帧、局部 patch、clean plate、参考 LUT 或 motion reference,再进入 Nuke 做真实合成。

检查重点

导回 Nuke 后优先检查透视、光向、黑白位、景深、颗粒、镜头畸变、运动模糊和帧间一致性。

模型能生成视频和声音不代表能满足交付标准,最终仍要按项目的色彩管理、分辨率、授权和镜头连续性要求验收。