AI AI工具情报站
国内AI动态 paper

小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统

📰 公众号:小红书技术(dots.llm) 📅 2026-07-16

核心亮点

小红书技术团队联合北京大学、上海交通大学,提出了名为 HYPIC 的系统,据称是全球首个面向混合注意力大模型的位置无关(position-independent)缓存方案。在混合注意力架构上,HYPIC 将首 token 延迟平均降低 3.25 倍;在 4 个生产级模型上,相同服务质量目标(SLO)下可持续 QPS 提升 1.66 倍,而任务质量与完全重算仅相差 1.71 分,在工程收益与输出质量之间取得了罕见平衡。

具体能力或事件经过

传统 KV 缓存高度依赖 token 的绝对位置:前缀一旦变化,缓存即失效,必须全部重算,造成严重算力浪费。HYPIC 的核心思路是解耦“位置”与“内容”,让缓存不再绑定绝对坐标,从而支持更灵活的复用。团队在四个真实生产模型上验证了该方案,覆盖不同业务流量,证明其在真实负载下也能稳定带来吞吐与延迟的双重收益。

技术细节

混合注意力(hybrid attention)指模型交替使用全注意力和滑动窗口等高效注意力,这给缓存带来了新挑战:不同注意力类型的状态难以用统一方式复用。HYPIC 通过位置无关的设计,使不同前缀产生的缓存可在请求间安全共享。1.71 分的任务质量差异意味着,相比逐 token 完全重算,用户几乎感知不到精度损失,却换来了 3 倍以上的首 token 提速。

与竞品对比

当前主流推理优化多围绕连续批处理、PagedAttention、投机解码等展开,缓存复用仍普遍受限于绝对位置。HYPIC 的差异化在于从“位置耦合”这一根因入手,而非在表层做调度优化。相比纯算法层面的蒸馏或量化,它更贴近系统层的部署痛点,对已经上线的生产模型友好,无需重训即可收益。

行业影响或适用场景

说白了,HYPIC 解决的是大模型“贵且慢”的落地顽疾。对小红书这类高并发、多模型、内容形态丰富的平台,首 token 延迟和可持续 QPS 直接决定用户体验与算力成本。该工作由企业联合高校完成,体现了国内“产研协同”的务实路径。若位置无关缓存被更多推理框架采纳,有望成为大模型服务降本增效的通用基础设施,也为混合注意力架构的普及扫清了工程障碍。