中国数智化转型网 人工智能资讯 每日人工智能资讯|谷歌I/O 2026发布Gemini Omni 世界模型开启视频对话式编辑

每日人工智能资讯|谷歌I/O 2026发布Gemini Omni 世界模型开启视频对话式编辑

据博客园、新浪科技7月28日报道,谷歌在2026 I/O开发者大会重磅发布Gemini Omni,DeepMind CEO Demis Hassabis亲自登台介绍规格。Gemini Omni被定位为”世界模型”,一个支持”任何输入到任何输出”的全能多模态模型。

Gemini Omni支持图片、音频、视频、文字的任意组合输入,并可生成高质量视频内容。最关键的功能突破是支持自然语言对话式视频编辑,用户上传一段骑行视频并说”把背景换成雪地”,模型即可精准完成背景替换。

Gemini Omni定价策略延续谷歌”智能便宜”路线,API定价较GPT-5.6 Sol版降低70%。谷歌同步发布Gemini 3.5 Pro、Gemini 3.5 Flash、Gemini 3.5 Flash-Lite三档分层模型,覆盖从深度推理到端侧部署的全场景。业内人士分析,Gemini Omni代表多模态大模型从”理解世界”走向”创造世界”的关键跃迁。

谷歌Gemini Omni的「世界模型」定位被业界视为多模态AI的下一个里程碑。DeepMind CEO Demis Hassabis在演讲中表示,世界模型不仅能理解世界,更能创造世界,这是AI从感知智能走向认知智能的关键标志。Gemini Omni通过原生多模态架构,将文本、图像、视频、音频的编码统一到同一向量空间,消除了传统多模态模型的模态对齐损耗。

商业化层面,谷歌同步发布Gemini 3.5系列三档分层模型:Pro版定价为输入3美元/百万tokens、输出12美元/百万tokens,Flash版定价为输入0.3美元/百万tokens、输出1.2美元/百万tokens,Flash-Lite版定价为输入0.03美元/百万tokens、输出0.12美元/百万tokens。整体定价较GPT-5.6 Sol版降低70%,延续谷歌「智能便宜」路线。Gemini Omni API将于8月15日开放公测,企业客户可通过Vertex AI平台申请接入。

Gemini Omni的世界模型能力在多项评测中得到验证。在视频理解基准VideoMME上,Gemini Omni以87.6%准确率刷新SOTA;在多模态推理基准MMMU-Pro上得分82.4%,领先GPT-5.6 Sol版3.2个百分点。谷歌同步发布Gemini Omni Studio创作工具套件,支持视频编辑、图像生成、音乐创作等多模态内容生产,与Adobe、Canva等创意软件形成正面竞争。

若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

思思企微
思思企微

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

鹿鸣企微
Jasper企微

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

底部图片
免责声明: 本网站(http://www.szhzxw.cn/)内容主要来自原创、合作媒体供稿和第三方投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。 本网站刊载的所有内容(包括但不仅限文字、图片、LOGO、音频、视频、软件、程序等) 版权归原作者所有。任何单位或个人认为本网站中的内容可能涉嫌侵犯其知识产权或存在不实内容时,请及时通知本站,予以删除。https://www.szhzxw.cn/134107.html
联系我们

联系我们

17717556551

邮箱: editor@cxounion.org

关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
返回顶部