英伟达全新Star Attention,10倍加速推理,登顶HF论文榜

Star Attention显著提高LLM推理速度,在长上下文任务中加速比高达11倍,同时精度损失极小;通过将上下文分块处理,Star Attention有效降低计算成本,支持边缘设备处理更长序列;Star Attention无缝集成至现有大模型,减少内存需求,实现更高效的推理,适用于本地和云端部署。

搜索