全闪存服务器实现高性能向量检索,硬件成本节省超90%
核心亮点
小红书引擎架构团队在 OSDI 2026 上提出 HELMSMAN,一个面向全闪存(All-Flash)服务器的高性能向量近似最近邻(ANN)搜索系统。它最惊人的数字是:用约 40 台全闪存服务器,承载了过去需要约 35,000 CPU Core 与约 350 TB DRAM 才能扛住的负载,硬件成本节省超过 90%。简单来说,它证明了“用闪存替代内存做向量检索”不仅可行,而且便宜到颠覆。
具体能力或事件经过
向量检索是推荐、搜索、RAG 的底层支柱,传统方案高度依赖大内存来装下海量向量索引,导致机器又贵又难扩。HELMSMAN 的思路是放弃“内存中心”,改走“闪存中心”:用集群式索引把数据打散到多台全闪存服务器,配合定制化存储栈与分层学习式搜索剪枝,在保住召回率的同时把访问打到闪存上。结果是同样的业务规模,服务器数量与总拥有成本断崖式下降。
技术细节
具体看三块设计。其一是聚类式索引,把向量空间分簇,让查询只在相关簇内展开,避免全量扫描。其二是定制化存储栈,针对 NVMe 闪存的带宽与延迟特征重写 IO 路径,减少软件栈开销。其三是分层学习式搜索剪枝,用轻量模型在检索过程中动态丢弃低概率分支,进一步压低计算量。三者叠加,才让“闪存扛向量”在延迟与吞吐上都能站住脚。
与竞品对比
相比基于纯内存的向量数据库,HELMSMAN 用容量更大、单价更低的闪存替代昂贵 DRAM,单位成本优势极其突出;相比通用分布式方案,它的存储栈与剪枝是为 ANN 专门定制的,效率更高。对同样面临海量向量与成本压力的公司,这是一条可借鉴的工程路线,而不只是论文里的指标。
行业影响或适用场景
说白了,向量检索的成本墙一直是 AI 应用落地的隐形门槛。HELMSMAN 的思路一旦被业界跟进,推荐系统、多模态检索、企业级 RAG 的基建开支都有望大幅压缩,让中小团队也用得起大规模向量服务。作为业务驱动型的系统论文,它再次说明:顶会成果不一定来自实验室,也可能来自真实流量下的工程逼迫。