我们把SGLang带到了NVIDIA的Vera Rubin上,并加速了Kimi K3的推理。和@NVIDIA紧密合作,我们在早期的Rubin硬件上优化了注意力机制、MoE和推测性验证内核。亮点包括:• 在batch 1 / 128K上下文下,FP8 MLA快了最多20%• KDA验证快了20%,并且输出完全一致• 通过MoE尾部融合,端到端推理速度提升了5.9%,每个解码步骤减少了276次内核启动。SGLang还支持Miles在Rubin上的端到端RL训练,包括在Vera CPU上同时运行64个沙盒的代理RL。完整的结果和技术细节稍后公布。
—— SemiAnalysis (@SemiAnalysis) X帖子|2026-10-09T23:23:10+00:00
原帖:<a href="https://x.com/SemiAnalysis/status/2108744981032960424" target="blank" rel="noopener">https://x.com/SemiAnalysis/status/2108744981032960424
SemiAnalysis:我们把SGLang带到了NVIDIA的Vera Rubin上…
我们把SGLang带到了NVIDIA的Vera Rubin上,并加速了Kimi K3的推理。和@NVIDIA紧密合作,我们在早期的Rubin硬件上优化了注意力机制、MoE和推测性验证内核。亮点包括:• 在batch 1 / 128K上下文下
扫描二维码,在手机上阅读
