数智化转型网 人工智能资讯 每日人工智能资讯|英伟达让AI学会”抄作业”:KV缓存可跨模型迁移,推理速度暴增25倍

每日人工智能资讯|英伟达让AI学会”抄作业”:KV缓存可跨模型迁移,推理速度暴增25倍

英伟达的研究团队取得了一项突破:他们找到了让KV缓存在不同模型之间迁移的方法。目标模型可以直接跳过预填充阶段,转换速度比重新处理上下文快2. 7 到 25 倍。数智化转型网www.szhzxw.cn

要理解这个突破的意义,需要先了解KV缓存的作用。在使用ChatGPT或Claude时,你会发现第一个词的生成总是明显更慢,然后后面的内容几乎是瞬间涌出。这背后是一个刻意设计的机制——模型在生成第一个词之前,需要处理整个输入上下文,把中间结果存储为KV缓存。之后的每个词都可以复用这些缓存,所以速度快得多。

问题在于,KV缓存一直是”一次一模型”的。如果你切换到另一个模型,或者升级了模型版本,之前计算好的缓存就全废了,新模型必须从头开始处理整个上下文。对于长文本场景,这意味着大量的重复计算和时间浪费。

英伟达的方案让KV缓存变得可迁移。一个模型计算出的缓存,经过转换后可以被另一个模型直接使用,目标模型完全跳过预填充阶段。转换过程本身也比重新处理上下文快得多——速度提升在2. 7 倍到 25 倍之间,具体取决于模型和上下文的复杂度。数智化转型网www.szhzxw.cn

这对AI行业的影响是深远的。当前LLM API的使用成本中有相当一部分来自上下文处理,尤其是长对话和长文档场景。如果KV缓存可以在模型之间迁移,意味着用户在切换模型时不必承担重复计算的成本,模型升级时也不必丢弃已有的对话上下文。这项研究可能会改变AI推理基础设施的设计方式,让模型之间的切换变得更加流畅和经济。

若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

思思企微
思思企微

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

鹿鸣企微
Jasper企微

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

底部图片
免责声明: 本网站(http://www.szhzxw.cn/)内容主要来自原创、合作媒体供稿和第三方投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。 本网站刊载的所有内容(包括但不仅限文字、图片、LOGO、音频、视频、软件、程序等) 版权归原作者所有。任何单位或个人认为本网站中的内容可能涉嫌侵犯其知识产权或存在不实内容时,请及时通知本站,予以删除。https://www.szhzxw.cn/137182.html
联系我们

联系我们

17717556551

邮箱: editor@cxounion.org

关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
返回顶部