据博客园、新浪科技7月28日报道,谷歌在2026 I/O开发者大会重磅发布Gemini Omni,DeepMind CEO Demis Hassabis亲自登台介绍规格。Gemini Omni被定位为”世界模型”,一个支持”任何输入到任何输出”的全能多模态模型。
Gemini Omni支持图片、音频、视频、文字的任意组合输入,并可生成高质量视频内容。最关键的功能突破是支持自然语言对话式视频编辑,用户上传一段骑行视频并说”把背景换成雪地”,模型即可精准完成背景替换。
Gemini Omni定价策略延续谷歌”智能便宜”路线,API定价较GPT-5.6 Sol版降低70%。谷歌同步发布Gemini 3.5 Pro、Gemini 3.5 Flash、Gemini 3.5 Flash-Lite三档分层模型,覆盖从深度推理到端侧部署的全场景。业内人士分析,Gemini Omni代表多模态大模型从”理解世界”走向”创造世界”的关键跃迁。
谷歌Gemini Omni的「世界模型」定位被业界视为多模态AI的下一个里程碑。DeepMind CEO Demis Hassabis在演讲中表示,世界模型不仅能理解世界,更能创造世界,这是AI从感知智能走向认知智能的关键标志。Gemini Omni通过原生多模态架构,将文本、图像、视频、音频的编码统一到同一向量空间,消除了传统多模态模型的模态对齐损耗。
商业化层面,谷歌同步发布Gemini 3.5系列三档分层模型:Pro版定价为输入3美元/百万tokens、输出12美元/百万tokens,Flash版定价为输入0.3美元/百万tokens、输出1.2美元/百万tokens,Flash-Lite版定价为输入0.03美元/百万tokens、输出0.12美元/百万tokens。整体定价较GPT-5.6 Sol版降低70%,延续谷歌「智能便宜」路线。Gemini Omni API将于8月15日开放公测,企业客户可通过Vertex AI平台申请接入。
Gemini Omni的世界模型能力在多项评测中得到验证。在视频理解基准VideoMME上,Gemini Omni以87.6%准确率刷新SOTA;在多模态推理基准MMMU-Pro上得分82.4%,领先GPT-5.6 Sol版3.2个百分点。谷歌同步发布Gemini Omni Studio创作工具套件,支持视频编辑、图像生成、音乐创作等多模态内容生产,与Adobe、Canva等创意软件形成正面竞争。
若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

本文由数智化转型网(www.szhzxw.cn)转载,编辑/翻译:数智化转型网(Professionalism Achieves Leadership 专业造就领导者)白龙
