数智化转型网 人工智能资讯 每日人工智能资讯|蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash

每日人工智能资讯|蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash

7月24日,蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-Flash。该模型总参数量124B,单次计算激活5.1B。在大幅精简体量与降低算力开销的同时,Ling-3.0-Flash 在基础推理、指令遵循及长文本处理等核心指标上,对标甚至超越了参数规模达其2至3倍的行业领先模型,展现出更高的“智效比”与落地性价比。据了解,该模型已上线OpenRouter,限时免费一周,之后将正式开源。数智化转型网www.szhzxw.cn

作为该版本的重点,Ling-3.0-Flash 针对Agent的实际应用场景进行了深度打磨。模型扩展了超10000个真实交互训练环境,并优化了复杂任务的自我纠错与长程规划机制。无论是在代码编写、复杂任务拆解,还是多源信息深度调研等场景中,Ling-3.0-Flash 均展现出更强的自主闭环交付能力,解决了传统模型在大任务中容易“跑偏”或断档的难题。

据介绍,实现“小体量、高智能”的关键,源于模型底层计算架构的重新设计。Ling-3.0-Flash 放弃了单纯堆砌参数的思路,从预训练阶段即采用混合注意力架构,以5:1的比例交替堆叠 KDA 线性注意力层与 MLA 层,让模型在长上下文效率与模型能力之间实现更优平衡。数智化转型网www.szhzxw.cn

此外,Ling-3.0-Flash将上一代的 Lightning Attention 升级为 KDA(Kimi Delta Attention),在 Delta Rule 的状态更新中引入细粒度对角门控,让模型在处理长文档和代码库时能更精准地记住关键信息。同时,Ling-3.0-Flash进一步压缩了单次计算的专家激活比例,每个 Token 的专家激活比例由前代的1/32进一步压缩至1/64,并由此带来了更高的“效率杠杆”。数智化转型网www.szhzxw.cn

为了让 AI Agent 运行更快、更稳,百灵还为其匹配了配套的工程与协作架构。在响应速度上,通过引入集群级分级缓存,避免了长对话和多轮交互中的重复计算,将长输入下的首字响应延迟降低了60% 至80% 以上;在任务稳定性上,升级后的多智能体协同架构允许不同 Agent 分工协作、相互校验,有效减少了单一模型的误判风险,为高频线上服务与真实业务落地提供了支撑。数智化转型网www.szhzxw.cn

若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

思思企微
思思企微

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

鹿鸣企微
Jasper企微

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

底部图片
免责声明: 本网站(http://www.szhzxw.cn/)内容主要来自原创、合作媒体供稿和第三方投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。 本网站刊载的所有内容(包括但不仅限文字、图片、LOGO、音频、视频、软件、程序等) 版权归原作者所有。任何单位或个人认为本网站中的内容可能涉嫌侵犯其知识产权或存在不实内容时,请及时通知本站,予以删除。https://www.szhzxw.cn/135239.html
联系我们

联系我们

17717556551

邮箱: editor@cxounion.org

关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
返回顶部