行业资讯
📅 2026/8/29 18:20:41
Gemini Omni 1.1 Flash 发布:场景扩展上限 40 秒,AI 视频生成转向可控
8 月 27 日谷歌在 Google AI Studio 和 Gemini API 上正式推出 Gemini Omni 1.1 Flash一个面向开发者的视频生成模型更新。这次的重点不是参数或画质口号而是把生成视频往导演视频的方向推场景扩展、首尾帧指定、4K 输出外加更便宜的 360p 预览。对做视频工具、内容生产的人来说这是一次工作方式的改变不是版本号 0.1 那么简单。这个热点的技术本质是什么先看几个关键变化都来自 Google 官方博客的说明场景扩展模型现在可以分析最多10 秒的先前视频上下文而之前只参考最后一秒。按 10 秒步长逐段延长单条视频累计最长 40 秒。首尾帧生成指定第一帧和最后一帧模型生成中间的连续画面适合运镜、转场、无缝循环这类需求。4K/1080p 输出可以直接出高清成片省掉生成完再超分这一步。360p 预览据报道据 Google 官方博客360p 草稿比 720p 生成快最多 60%成本约是 720p 的三分之一。视频参考多模态输入里可以引用最多 3 秒的视频保持角色和画面一致性。技术上这不是新架构Gemini Omni 系列的底子没变变的是一整套控制手段。以前生成视频基本是抽卡写个 prompt出一段不满意就重抽最多改改文字。现在模型能理解已有视频的内容再继续往下接能按关键帧约束镜头运动等于把剪辑师的工作流拆成了模型可以执行的动作。变了什么没变什么变了的是成本结构和工作流草稿阶段用 360p 快速迭代、定稿阶段出 4K这在以前是做不到的——之前不管成不成型都按同样的分辨率烧钱。据报道 Adobe Firefly、Figma Weave、Runway、GMI Cloud 等都已接入该模型说明这类可控视频能力正在快速成为创作工具的标配。没变的是生成式模型的老毛病长镜头下角色一致性、物理细节仍然要靠人工挑素材兜底40 秒是累计上限而非单次上限叙事稍长就得分段生成再拼接所谓的控制是概率上的控制不是关键帧动画那种确定性控制。指望它一次出片目前还不现实。对普通开发者意味着什么如果你在折腾视频生成、短视频工具、营销物料自动化这个模型值得直接上手。官方博客给了场景扩展的 Python 示例我抄过来做示范代码来自 Google 官方文档fromgoogleimportgenai clientgenai.Client()interactionclient.interactions.create(modelgemini-omni-1.1-flash,previous_interaction_idprevious_video_interaction.id,input[{type:text,text:Continue the scene.}],response_format{resolution:360p},) 几个实际建议-**草稿和成片分开跑**先用 360p 确认叙事和镜头定了再出 4K。官方口径是成本差三倍量大的项目这不是小钱。--**长视频用步进式扩展**10秒一步往外扩比一次生成更容易控制情节走向也方便中途修正。--**有运镜需求的优先用首尾帧**指定起止帧让模型补中间比在 prompt 里描述镜头缓缓推进稳定得多。--**别省掉素材检查**多模态参考只有3秒复杂场景的角色一致性依然要自己做参考图/参考视频的管理指望一条 prompt 全搞定不现实。 坑也明摆着一是计费按分辨率、时长走官方给的三分之一成本是相对 720p 的口径做预算前先跑小样实测二是 API 形态还在快速迭代接的时候尽量把模型调用层封装好别把版本号写死在业务代码里。## 结尾视频生成打到了第二阶段不是能不能生成而是能不能按我的意思生成。控制手段越多离落地就越近至于成本算不算得过来得等真跑完一轮才知道。你怎么看评论区聊聊。