近日,小红书集团正式对外发布并开源长文本大模型推理加速框架 RedKnot。该项目由小红书主导研发,北京大学、华为云提供合作支持,凭借"按注意力头分类复用键值缓存(KV)与弹性稀疏"的创新技术路线,在国内外开源社区引发广泛关注。项目的核心研发工作由小红书引擎架构部 AI Infra 团队的萧逸, 安兹等人完成。
随着大模型上下文窗口不断拉长,长文本推理场景下的显存占用与首字延迟(TTFT)已成为大模型服务规模化落地的核心瓶颈。如何在不牺牲精度的前提下降低计算开销、提升响应速度,是当前人工智能推理系统亟需攻克的关键难题。RedKnot 提出的核心思路是:并非每个注意力头都需要完整的键值缓存,也并非每个词元(token)都需要经过完整的前馈网络计算。基于这一判断,该框架构建于开源推理引擎 SGLang 之上,作为注意力层扩展进行集成,同时完整保留了原有引擎的高性能服务能力。在技术实现上,RedKnot 将模型中的每个注意力头划分为"全局、局部、检索、稠密"四类,并按类别分别决定键值缓存的存储与复用策略;同时通过离线键值缓存复用与旋转位置编码(RoPE)重定位技术,在服务时仅选择性重算必要词元,保证数值对齐;此外,框架还引入了基于注意力重要性的稀疏前馈网络,跳过低贡献词元的计算,并配套设计了分段分页注意力(SegPagedAttention)运行时。
据介绍,在保持近乎无损精度、部分场景下甚至优于稠密基线的前提下,RedKnot 可将长文本预填充阶段的计算量降低约百分之五十至七十,并带来一点三五倍至二点二倍的首字延迟加速,且上下文越长,加速收益越显著。在小红书团队公布的实测数据中,以完整注意力计算作为基线,在主流模型的多跳问答任务上,16K 至 32K 上下文长度下模型准确率始终不低于基线,首字延迟加速由一点三九倍提升至一点九三倍,计算量稳定节省约百分之七十。在 Qwen3.5 系列混合专家模型上,首字延迟加速随上下文增长最高可达二点一六倍。团队同时坦诚公布了框架在部分模型上仍待优化的已知问题,展现出严谨务实的科研态度。
据悉,RedKnot 的配套学术论文已同步公开。本次开源为基础版本,团队表示 DeepSeek-V4 与完整 Qwen 3.5 系列将在下一版本中完整适配更新。项目采用 Apache-2.0 开源协议,面向全球开发者开放,并提供可一键复现的完整基准测试。
国内外的业内人士普遍认为,RedKnot 由企业主导、联合高校与云服务厂商协同攻关,既体现了产学研深度融合的创新模式,也为国产大模型推理基础设施的发展提供了新的技术路径。
免责声明:该文章系我网转载,旨在为读者提供更多新闻资讯。所涉内容不构成投资、消费建议,仅供读者参考。