❓ Describe the question
您好,
我是HW这边专门做NPU推理加速的研发小组leader,在xllm Technical Report (Mar 2026) Section 5.1中,看到业务可能存在不少短上下文(1K到6K输入,10s到100s长度输出)推理场景。
针对此类场景,我们内部做过一个卡内PD并行竞争力原型。竞争力原理大致为:对于短上下文任务(尤其是Decode),随着NPU上AICORE投入数量的增多,任务所获得的边际性能收益有显著递减的。例如2K长度上下文,A3上若只投入一个AICORE, 时延大约为213ms, 投入全部24个AICORE时,时延约为19.8ms, 加速效率仅为45%(213/19.8/24). 将AICORE数量从24调整为16时,时延为21.72,加速效率提高为61.3%(213/21.7/16), 节约出来的8个AICORE, 则可以投入到向Prefill这样边际收益更高的任务上, 提高整卡对业务的综合吞吐.
目前我本地有围绕vllm-ascend打通的技术原型,针对xllm Tech Report中提到的负载,可呈现15%~20%+的吞吐收益(视TTFT/TPOT要求而定)。后续可以结合业务TTFT/TPOT需求,追加一套围绕卡内PD并行的动态调度算法,最终瞄准落地。昨日内部评审时,评委希望先确认一下京东这边的业务规模/价值,再做投入决策.
请问能否有渠道了解一些相关信息?感谢!
❓ Describe the question
您好,
我是HW这边专门做NPU推理加速的研发小组leader,在xllm Technical Report (Mar 2026) Section 5.1中,看到业务可能存在不少短上下文(1K到6K输入,10s到100s长度输出)推理场景。
针对此类场景,我们内部做过一个卡内PD并行竞争力原型。竞争力原理大致为:对于短上下文任务(尤其是Decode),随着NPU上AICORE投入数量的增多,任务所获得的边际性能收益有显著递减的。例如2K长度上下文,A3上若只投入一个AICORE, 时延大约为213ms, 投入全部24个AICORE时,时延约为19.8ms, 加速效率仅为45%(213/19.8/24). 将AICORE数量从24调整为16时,时延为21.72,加速效率提高为61.3%(213/21.7/16), 节约出来的8个AICORE, 则可以投入到向Prefill这样边际收益更高的任务上, 提高整卡对业务的综合吞吐.
目前我本地有围绕vllm-ascend打通的技术原型,针对xllm Tech Report中提到的负载,可呈现15%~20%+的吞吐收益(视TTFT/TPOT要求而定)。后续可以结合业务TTFT/TPOT需求,追加一套围绕卡内PD并行的动态调度算法,最终瞄准落地。昨日内部评审时,评委希望先确认一下京东这边的业务规模/价值,再做投入决策.
请问能否有渠道了解一些相关信息?感谢!