跳到主要内容

大模型长上下文成本高?PIC缓存技术让预填充不再烧钱

31 0
AI摘要

大模型服务正转向复杂负载,如检索增强问答和多文档摘要,其prompt由多个独立片段组成,形成超长上下文。预填充阶段成为主要算力开销,缓存未命中时尾部首token延迟高。业界采用位置无关缓存(PIC)和混合注意力模型降本。PIC通过拼接和修正实现高效缓存,混合注意力模型则用线性注意力降低复杂度并压缩历史信息。

混合模型缓存瓶颈

大模型长上下文成本高?PIC缓存技术让预填充不再烧钱

预填充阶段, 占据着单请求的主要算力开销, 进而成为服务商显著的成本负担, 一旦出现缓存未命中的情况, 首Token延迟能够达到数十秒, 严重地破坏了交互体验。

现有PIC技术靠逐Token KV缓存, 然而线性注意力层只暴露循环状态,只是由于这种结构上的差异, 相当数量的层就到了PIC可容纳规模, 不足以善用Cache效能。

核心技术突破

HYPIC破天荒地给混合注意力模型供应位置无关缓存, 去化解线性层跟全注意力层兼容性方面棘手的难题咧, 经由分而治之相应策略, 各自对两类层的缓存机制加以优化。

大模型长上下文成本高?PIC缓存技术让预填充不再烧钱

系统归入段积累性转移算子, 达成常数计时状态组合, 相比较简约相加方式, 规避了构造化误差, 保证于复杂线性注意力之下计算的精准性。

缝合窗口修复对齐

团队针对全注意力层, 是发现了KV拼接偏差, 该偏差集中于复用片段开头, 所以要为此构造一个缝合窗口, 此窗口用于在片段起始处缓存少量Token, 进而修复跨段注意力对齐问题。

这个窗口的大小, 被设定为默认的数值8, 只因实际的片段长度较长, 因此重新计算所花费的开销, 是极小的。该情形不仅保证了精度, 还对额外的计算成本进行了控制, 从而完美地匹配了混合架构的特性。

段并行加速冷请求

传统的系统, 是以串行的方式去处理冷片段的, 其延迟会跟随着请求的长度呈现出线性增长的态势。HYPIC提出了实例间的段并行这种方式, 它把冷片段分发到多个节点当中, 进而大幅降低了长请求的处理时间。

采取最长处理时间优先策略来均衡负载, 去进行重叠计算与传输。段并行跟实例内并行进行正交叠加, 从而显著提升系统在极端负载情形下的扩展能力。

实测性能大幅提升

在针对四个生产级模型所开展的测试当中, HYPIC致使首Token延迟平均出现了下降, 下降幅度达到3.25倍, 同时, 其还能够让可持续QPS出现提升, 提升幅度为1.66倍。任务质量与处于完全重算这种情况下两者相较之间的差距仅仅只有1.71分, 这种差异近似于可以忽略不计, 达到近乎无损之状。

32k Token长请求情形下, 纯冷路径延迟, 从原来的2.83秒降低到了0.49秒, 加速达到了5.7倍左右。并且, 构造开销仅仅是主前向的5%至6.7%之间, 性价比是非常高的。

行业应用前景展望

HYPIC技术证实了混合注意力模型缓存具备可行性, 给云服务商削减成本提供了新途径, 伴着更多模型运用混合架构, 这类系统将会变成基础设施的标配。

正处于你所在之地的企业, 是不是正遭遇着大模型推理成本高高在上的状况? 欢迎于评论区域分享你所生出的看法, 并且点一个赞, 以此来支持更多前沿技术的阐释。

登录后参与评论

评论仅开放给已登录并完成邮箱绑定的用户。

评论 0

暂无评论。