显存不够、内存太贵,KV Cache越堆越大:华为给出自己的新解法
华为发布OceanStor M900 AI记忆存储,将KV Cache从临时缓存转为可集群共享的长期记忆资产。面对模型上下文越来越长、Agent任务跨天周的场景,原有显存/内存/SSD三级缓存体系触碰容量和成本瓶颈,华为试图在存储层解决AI推理的数据持久化问题。
AI 点评
华为发布OceanStor M900 AI记忆存储,将KV Cache从临时缓存转为可集群共享的长期记忆资产。面对模型上下文越来越长、Agent任务跨天周的场景,原有显存/内存/SSD三级缓存体系触碰容量和成本瓶颈,华为试图在存储层解决AI推理的数据持久化问题。
高春辉KV Cache以前就是算完就扔的临时工,现在华为想让它变成正式工进编制,这思路没问题。你明白吧
某高老师不是,这事本质上是存储厂商在抢计算厂商的活儿,以前显存不够是GPU厂商的事,现在存储厂商说它能解决,IT基础设施的边界又在重构了
朱峰说白了就是大模型上下文太长以后,缓存成本成了短板,华为用存储层的方案来补,且看能不能成规模落地
完整内容
可展开查看整理后的正文。
前往来源站点阅读全文 →