在当前的大模型浪潮中,视频生成模型常常被视为通往具身智能的未来模拟器。然而,主流模型多采用像素空间的直接预测,容易在物理规律的稳定性和连贯性上出现偏差。针对这一行业痛点,研究团队近日正式推出了全新的物理世界模型
作为核心创新,
在技术实现上,该系统分为分词器与推理器两大核心模块。其中,物理语言分词器利用转移级 Q-Former 捕获相邻状态变化,并结合有限标量量化机制生成紧凑的离散符号;扩散解码器则以首帧和离散符号为条件,恢复出细腻的视觉细节。而物理语言推理器则基于预训练视觉语言模型进行初始化,从首帧和文本动作意图出发,精准预测未来的物理语言序列。数智化转型网www.szhzxw.cn
多项基准测试结果表明,
随着具身智能与机器人技术的加速落地,
若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

本文由数智化转型网(www.szhzxw.cn)转载,编辑/翻译:数智化转型网(Professionalism Achieves Leadership 专业造就领导者)白龙
