小红书集团主导开源长文本大模型推理加速引擎 RedKnot

小红书集团主导开源长文本大模型推理加速引擎 RedKnot

来源:河北青年报 2026-07-02 14:58
  • weixin
  • weibo
  • qqzone
分享到微信

近日,小红书集团正式对外发布并开源长文本大模型推理加速框架 RedKnot。该项目由小红书主导研发,北京大学、华为云提供合作支持,凭借"按注意力头分类复用键值缓存(KV)与弹性稀疏"的创新技术路线,在国内外开源社区引发广泛关注。项目的核心研发工作由小红书引擎架构部 AI Infra 团队的萧逸, 安兹等人完成。

随着大模型上下文窗口不断拉长,长文本推理场景下的显存占用与首字延迟(TTFT)已成为大模型服务规模化落地的核心瓶颈。如何在不牺牲精度的前提下降低计算开销、提升响应速度,是当前人工智能推理系统亟需攻克的关键难题。RedKnot 提出的核心思路是:并非每个注意力头都需要完整的键值缓存,也并非每个词元(token)都需要经过完整的前馈网络计算。基于这一判断,该框架构建于开源推理引擎 SGLang 之上,作为注意力层扩展进行集成,同时完整保留了原有引擎的高性能服务能力。在技术实现上,RedKnot 将模型中的每个注意力头划分为"全局、局部、检索、稠密"四类,并按类别分别决定键值缓存的存储与复用策略;同时通过离线键值缓存复用与旋转位置编码(RoPE)重定位技术,在服务时仅选择性重算必要词元,保证数值对齐;此外,框架还引入了基于注意力重要性的稀疏前馈网络,跳过低贡献词元的计算,并配套设计了分段分页注意力(SegPagedAttention)运行时。

据介绍,在保持近乎无损精度、部分场景下甚至优于稠密基线的前提下,RedKnot 可将长文本预填充阶段的计算量降低约百分之五十至七十,并带来一点三五倍至二点二倍的首字延迟加速,且上下文越长,加速收益越显著。在小红书团队公布的实测数据中,以完整注意力计算作为基线,在主流模型的多跳问答任务上,16K 至 32K 上下文长度下模型准确率始终不低于基线,首字延迟加速由一点三九倍提升至一点九三倍,计算量稳定节省约百分之七十。在 Qwen3.5 系列混合专家模型上,首字延迟加速随上下文增长最高可达二点一六倍。团队同时坦诚公布了框架在部分模型上仍待优化的已知问题,展现出严谨务实的科研态度。

据悉,RedKnot 的配套学术论文已同步公开。本次开源为基础版本,团队表示 DeepSeek-V4 与完整 Qwen 3.5 系列将在下一版本中完整适配更新。项目采用 Apache-2.0 开源协议,面向全球开发者开放,并提供可一键复现的完整基准测试。

国内外的业内人士普遍认为,RedKnot 由企业主导、联合高校与云服务厂商协同攻关,既体现了产学研深度融合的创新模式,也为国产大模型推理基础设施的发展提供了新的技术路径。


免责声明:该文章系我网转载,旨在为读者提供更多新闻资讯。所涉内容不构成投资、消费建议,仅供读者参考。

【责任编辑:程茜】
中国日报网版权说明:凡注明来源为“中国日报网:XXX(署名)”,除与中国日报网签署内容授权协议的网站外,其他任何网站或单位未经允许禁止转载、使用,违者必究。如需使用,请与010-84883777联系;凡本网注明“来源:XXX(非中国日报网)”的作品,均转载自其它媒体,目的在于传播更多信息,其他媒体如需转载,请与稿件来源方联系,如产生任何问题与本网无关。
版权保护:本网登载的内容(包括文字、图片、多媒体资讯等)版权属中国日报网(中报国际文化传媒(北京)有限公司)独家所有使用。 未经中国日报网事先协议授权,禁止转载使用。给中国日报网提意见:rx@chinadaily.com.cn
C财经客户端 扫码下载
Chinadaily-cn 中文网微信
×