Skip to content

[Question]: NPU上,针对短上下文推理加速的卡内PD并行技术。实验室已有原型,想确认对业务是否有帮助。 #1950

Description

@mingzhehao637-droid

❓ Describe the question

您好,

我是HW这边专门做NPU推理加速的研发小组leader,在xllm Technical Report (Mar 2026) Section 5.1中,看到业务可能存在不少短上下文(1K到6K输入,10s到100s长度输出)推理场景。

针对此类场景,我们内部做过一个卡内PD并行竞争力原型。竞争力原理大致为:对于短上下文任务(尤其是Decode),随着NPU上AICORE投入数量的增多,任务所获得的边际性能收益有显著递减的。例如2K长度上下文,A3上若只投入一个AICORE, 时延大约为213ms, 投入全部24个AICORE时,时延约为19.8ms, 加速效率仅为45%(213/19.8/24). 将AICORE数量从24调整为16时,时延为21.72,加速效率提高为61.3%(213/21.7/16), 节约出来的8个AICORE, 则可以投入到向Prefill这样边际收益更高的任务上, 提高整卡对业务的综合吞吐.

目前我本地有围绕vllm-ascend打通的技术原型,针对xllm Tech Report中提到的负载,可呈现15%~20%+的吞吐收益(视TTFT/TPOT要求而定)。后续可以结合业务TTFT/TPOT需求,追加一套围绕卡内PD并行的动态调度算法,最终瞄准落地。昨日内部评审时,评委希望先确认一下京东这边的业务规模/价值,再做投入决策.

请问能否有渠道了解一些相关信息?感谢!

Metadata

Metadata

Assignees

No one assigned

    Labels

    questionFurther information is requested

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions