作者 / Lindsey Lanquist
在 Google I/O 大会上,谷歌正式推出 Omni 系列首款模型——Gemini Omni Flash。该模型将物理规律理解与现实世界知识深度融合,让视频创作与编辑如同对话般自然。用户可通过文本、图像、音频或多模态参考素材生成高质量视频,甚至对现有视频进行智能化编辑。
目前,Omni 已向开发者开放,并迅速应用于多个创新项目中。以下是几个极具代表性的演示案例。
切换角度和视角
Omni 赋予视频编辑前所未有的灵活性。用户可自由调整镜头角度、切换环境背景或应用电影级变焦效果,且全程保持场景连贯性。
开发者 Leon Lin 利用这一能力,基于同一位站在城市中心的女性素材,生成了约 20 种不同视角的视频片段:涵盖近景与远景、正面与侧面、俯拍与仰拍;镜头既有推进也有静止。背景随之动态变化——人行道、斑马线、街道穿梭的行人车辆及有轨电车,以及风格各异的建筑群,均无缝衔接。
重塑周围的世界
Omni 支持对视频情节进行深度重构,创造出传统拍摄无法实现的画面。用户可修改动作细节或替换物体元素,而模型仍能维持整体场景逻辑统一。
开发者 Carlos Santana 仅通过语音指令,便将户外场景从白天转为夜晚:添加阴云密布的天空与雨声效果,树叶变为橙黄色,地面覆盖积雪,全程自然流畅。
赋予日常物品生命
结合 Google Flow 平台,Omni 可将手绘草图转化为逼真视频,并通过涂鸦引导元素运动轨迹。用户还可自主选择是否保留原始手绘痕迹。
开发者 Pan 展示了趣味十足的创意转化:柠檬化作海洋中起伏的潜水艇;浓缩咖啡杯变身穿越天空的热气球;两根辣椒组成沉睡喷火的巨龙;火柴重组为火箭飞船;剪刀则演化为觅食的鲨鱼,充满想象力。
尝试不同风格或视觉效果
Omni 支持风格迁移与特效叠加,用户可通过提供参考素材或自然语言描述,定义所需美学风格,模型将融合生成视觉统一的视频片段。
开发者 Jerrod Lew 使用 Google Flow 中的 Omni,将一段女性沿街行走的视频实时渲染为四种动画风格:真人实拍、日式动漫、黏土定格等,角色动作始终连贯自然,无断裂感。
将创意变为现实
Hyperagent 团队运用 Omni 实现三大概念可视化:在空旷公园视频中叠加景观设计方案,呈现改造前后对比;通过动画角色讲解业务仪表盘,实现数据拟人化;以游戏化角色逐项清空任务的方式,重构待办列表体验。
Omni 正成为连接知识与创造力的桥梁,助力构建符合现实逻辑的沉浸式场景。当前可在 Gemini 应用、Google Flow、Google AI Studio、Gemini API 及 Gemini Enterprise Agent Platform 中体验该能力。
- Gemini 应用
- Google Flow
- Google AI Studio
- Gemini API

