Skip to content

mindspeed-MM qwen3.5-4b Lora 微调报错,hccl 与 tensor.DTensor 不兼容 #4

Description

@yhl0626

mindspeed-MM qwen3.5-4b lora 微调报错:
错误:
核心问题不是前面的 warning,而是 LoRA 权重校验阶段触发了 HCCL 不支持的通信算子。

真正报错:RuntimeError: Backend hccl does not support allgather_into_tensor_coalesced
触发位置:mindspeed_mm/fsdp/utils/lora_weight_manager.py 的 verify_lora_weights()
它对 DTensor 调用了 full_tensor(),底层会走 all-gather。
在你当前 NPU + HCCL 环境下,这条 all-gather 路径(allgather_into_tensor_coalesced)不支持,所以多卡都在初始化模型后一起崩了。
最后的 awk syntax error 是连带现象:训练提前失败后,统计脚本拿不到迭代时间变量,才报这个错,不是主因。
前面这些基本都不是致命:

OMP_NUM_THREADS=1:性能提示
pkg_resources is deprecated:依赖告警
fast path is not available:会回退到 torch 实现,可跑但可能慢


环境:npu910b 8X32GB
npu-dirver 25.5.1
can 8.5.0
docker-image: swr.cn-south-1.myhuaweicloud.com/ascendhub--mindspeed-mm:2025.rc4-a2-arm
model: qwen3.5-4b
python 环境:

accelerate 1.2.0
gpytorch 1.14.3
mindspeed 0.12.1 /data/work/git/MindSpeed
mindspeed-mm 0.1 /data/work/git/MindSpeed-MM
numpy 1.26.0
torch 2.7.1
torch_npu 2.7.1.post2
torchaudio 2.7.1
torchdata 0.11.0
torchvision 0.22.1
transformers 5.2.0
verl_npu 0.0.1 /data/work/git/MindSpeed-MM/verl_plugin


任务:mindspeed-MM qwen3.5-4b Lora 微调
使用 examples/qwen3_5/finetune_qwen3_5_4B.sh
examples/qwen3_5/qwen3_5_4B_config.yaml 内容

并行策略

parallel:
fully_shard_parallel_size: auto
fsdp_plan:
apply_modules: # 如果要开prefetch的话,请不要随意修改apply_modules的顺序
- model.visual
- model.visual.blocks.{}
- model.language_model
- model.language_model.embed_tokens
- model.language_model.layers.{
}
- lm_head
param_dtype: bf16
reduce_dtype: fp32
recompute: true
recompute_plan:
apply_modules:
- model.language_model.layers.{*}
ulysses_parallel_size: 1 # 开启 ulysses-cp 时, 请将 model 的 attn_implementation 设置为 flash_attention_2

数据相关配置

data:
dataset_param:
dataset_type: huggingface
#数据集属性
attr:
images: images
messages: messages
role_tag: role
content_tag: content
user_tag: user
assistant_tag: assistant

# 数据预处理
preprocess_parameters:
  model_name_or_path: &HF_MODEL_LOAD_PATH ./ckpt/hf_path/Qwen35-xxB # 替换为原始hf权重
  use_fast_tokenizer: true
  split_special_tokens: false
  image_max_pixels: 262144
  image_min_pixels: 1024
  video_max_pixels: 16384
  video_min_pixels: 0
  video_fps: 2.0
  video_maxlen: 64

basic_parameters:
  cutoff_len: 1024
  template: qwen3_vl_nothink
  enable_thinking: false
  train_on_prompt: false
  mask_history: false
  dataset_dir: ./data
  dataset: &DATASET_PATH ./data/mllm_format_llava_instruct_data.json
  cache_dir: ./cache_dir/
  overwrite_cache: false
  preprocessing_batch_size: 1000
  preprocessing_num_workers: 16
  max_samples: null

数据加载

dataloader_param:
pin_memory: true
shuffle: false
dataloader_mode: sampler
drop_last: true
sampler_type: BaseRandomBatchSampler
num_workers: 8
collate_param:
model_name: qwen3vl
ignore_pad_token_for_loss: true

模型配置

model:
model_id: qwen3_5
model_name_or_path: *HF_MODEL_LOAD_PATH
trust_remote_code: true
attn_implementation: sdpa
freeze:
- model.visual

loss 配置

loss_cfg:
loss_type: default # If you want raw loss in model, loss_type can be set to "raw".
router_aux_loss_coef: 0.0

chunkloss配置

enable_chunk_loss: true
chunkloss_plan:
apply_module: lm_head
chunk_size: 1024

activation offload 配置

enable_activation_offload: false
activation_offload_plan:
apply_modules:
- model.visual.blocks.{}
- model.language_model.layers.{
}

融合算子配置

use_triton_gdn: true

训练配置

training:
micro_batch_size: 1
gradient_accumulation_steps: 1
seed: 42
lr: 1.0e-4
lr_decay_style: cosine
lr_warmup_ratio: 0.1
weight_decay: 0
train_iters: 10000
clip_grad: 0.0
init_model_with_meta_device: true
optimizer: adamw
adam_fused: true
save_interval: 10000
no_load_optim: true # Do not load optimizer state; remove if loading is needed.
no_load_rng: true # Do not load RNG state; remove if loading is needed.
no_save_optim: true # Do not save optimizer state; remove if saving is needed.
no_save_rng: true # Do not save RNG state; remove if saving is needed.

LoRA:仅训练低秩适配器,需安装 peft;续训可设置 pretrained_lora_path

lora:
enable: true
rank: 8
alpha: 16
dropout: 0.0
init_lora_weights: true
pretrained_lora_path: null
target_modules:
- model.language_model.layers.{}.self_attn.q_proj
- model.language_model.layers.{
}.self_attn.k_proj
- model.language_model.layers.{}.self_attn.v_proj
- model.language_model.layers.{
}.self_attn.o_proj
- model.language_model.layers.{}.mlp.gate_proj
- model.language_model.layers.{
}.mlp.up_proj
- model.language_model.layers.{*}.mlp.down_proj
load: ./ckpt/hf_path/Qwen35-xxB-dcp # 替换为转换后的dcp权重
save: ./save_path
use_deter_comp: false
plugin:
- mindspeed_mm/fsdp/models/qwen3_5
- mindspeed_mm/fsdp/data/datasets/huggingface

工具配置

tools:
profile:
enable: false
profile_type: static
ranks: [0]
static_param:
level: level1
with_stack: false
with_memory: false
record_shapes: false
with_cpu: true
save_path: ./profiling
start_step: 10
end_step: 11
data_simplification: false
aic_metrics_type: PipeUtilization
memory_profile:
enable: false
start_step: 1
end_step: 2
save_path: ./memory_snapshot
dump_ranks: [0]
stacks: all
max_entries: null
mem_info: false


报错信息:

省略了一些日志

[rank2]: Traceback (most recent call last):
[rank2]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/train/trainer.py", line 335, in
[rank2]: trainer = Trainer(args=args)
[rank2]: ^^^^^^^^^^^^^^^^^^
[rank2]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/train/trainer.py", line 71, in init
[rank2]: self.model = self.get_model(model_provider)
[rank2]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/train/trainer.py", line 179, in get_model
[rank2]: self.lora_weight_manager.verify_lora_weights()
[rank2]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/utils/lora_weight_manager.py", line 371, in verify_lora_weights
[rank2]: param_data = self._gather_dtensor(param.data) if self._is_dtensor(param.data) else param.data
[rank2]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/utils/lora_weight_manager.py", line 84, in _gather_dtensor
[rank2]: full_tensor = param_data.full_tensor()
[rank2]: ^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_api.py", line 570, in full_tensor
[rank2]: redist_res = self.redistribute(
[rank2]: ^^^^^^^^^^^^^^^^^^
[rank2]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_api.py", line 542, in redistribute
[rank2]: return Redistribute.apply(self, device_mesh, placements, async_op)
[rank2]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: File "/root/miniconda3/lib/python3.11/site-packages/torch/autograd/function.py", line 575, in apply
[rank2]: return super().apply(*args, **kwargs) # type: ignore[misc]
[rank2]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_redistribute.py", line 306, in forward
[rank2]: output = redistribute_local_tensor(
[rank2]: ^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_redistribute.py", line 213, in redistribute_local_tensor
[rank2]: new_local_tensor = current_placement._to_replicate_tensor(
[rank2]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/placement_types.py", line 260, in _to_replicate_tensor
[rank2]: result = funcol.all_gather_tensor(
[rank2]: ^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/_functional_collectives.py", line 205, in all_gather_tensor
[rank2]: tensor = torch.ops._c10d_functional.all_gather_into_tensor(
[rank2]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: File "/root/miniconda3/lib/python3.11/site-packages/torch/_ops.py", line 1158, in call
[rank2]: return self._op(*args, (kwargs or {}))
[rank2]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: RuntimeError: Backend hccl does not support allgather_into_tensor_coalesced
[rank2]: Exception raised from allgather_into_tensor_coalesced at /pytorch/torch/csrc/distributed/c10d/Backend.hpp:190 (most recent call first):
[rank2]: frame #0: c10::Error::Error(c10::SourceLocation, std::__cxx11::basic_string<char, std::char_traits, std::allocator >) + 0xd4 (0xffff95533ea4 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libc10.so)
[rank2]: frame #1: c10::detail::torchCheckFail(char const
, char const
, unsigned int, std::__cxx11::basic_string<char, std::char_traits, std::allocator > const&) + 0xe4 (0xffff954d3e44 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libc10.so)
[rank2]: frame #2: + 0x5d356f0 (0xffff9aef56f0 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank2]: frame #3: + 0x5d5f9e8 (0xffff9af1f9e8 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank2]: frame #4: + 0x5d6e26c (0xffff9af2e26c in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank2]: frame #5: + 0x811a24 (0xffff7b041a24 in /root/miniconda3/lib/python3.11/site-packages/torch_npu/lib/libtorch_npu.so)
[rank2]: frame #6: + 0x5d834f8 (0xffff9af434f8 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank2]: frame #7: + 0x5d48730 (0xffff9af08730 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank2]: frame #8: + 0x5d48b88 (0xffff9af08b88 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank2]: frame #9: + 0x5d46ddc (0xffff9af06ddc in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank2]: frame #10: + 0x811a24 (0xffff7b041a24 in /root/miniconda3/lib/python3.11/site-packages/torch_npu/lib/libtorch_npu.so)
[rank2]: frame #11: + 0x5c29be4 (0xffff9ade9be4 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank2]: frame #12: torch::jit::invokeOperatorFromPython(std::vector<std::shared_ptrtorch::jit::Operator, std::allocator<std::shared_ptrtorch::jit::Operator > > const&, pybind11::args const&, pybind11::kwargs const&, std::optionalc10::DispatchKey) + 0x140 (0xffffa003bb50 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank2]: frame #13: torch::jit::_get_operation_for_overload_or_packet(std::vector<std::shared_ptrtorch::jit::Operator, std::allocator<std::shared_ptrtorch::jit::Operator > > const&, c10::Symbol, pybind11::args const&, pybind11::kwargs const&, bool, std::optionalc10::DispatchKey) + 0x1dc (0xffffa003bdac in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank2]: frame #14: + 0xb3cf44 (0xffff9ff3cf44 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank2]: frame #15: + 0x588f5c (0xffff9f988f5c in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank2]: frame #16: /root/miniconda3/bin/python3.11() [0x4d1e68]
[rank2]: frame #17: _PyObject_Call + 0x68 (0x485728 in /root/miniconda3/bin/python3.11)
[rank2]: frame #18: _PyEval_EvalFrameDefault + 0x4b64 (0x42ad34 in /root/miniconda3/bin/python3.11)
[rank2]: frame #19: /root/miniconda3/bin/python3.11() [0x570874]
[rank2]: frame #20: _PyObject_FastCallDictTstate + 0x7c (0x485b4c in /root/miniconda3/bin/python3.11)
[rank2]: frame #21: _PyObject_Call_Prepend + 0x13c (0x485eb0 in /root/miniconda3/bin/python3.11)
[rank2]: frame #22: /root/miniconda3/bin/python3.11() [0x4f7c98]
[rank2]: frame #23: _PyObject_MakeTpCall + 0x98 (0x48595c in /root/miniconda3/bin/python3.11)
[rank2]: frame #24: _PyEval_EvalFrameDefault + 0x31c8 (0x429398 in /root/miniconda3/bin/python3.11)
[rank2]: frame #25: /root/miniconda3/bin/python3.11() [0x570874]
[rank2]: frame #26: + 0x9e6610 (0xffff9fde6610 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank2]: frame #27: /root/miniconda3/bin/python3.11() [0x4d1e38]
[rank2]: frame #28: _PyObject_Call + 0x68 (0x485728 in /root/miniconda3/bin/python3.11)
[rank2]: frame #29: _PyEval_EvalFrameDefault + 0x4b64 (0x42ad34 in /root/miniconda3/bin/python3.11)
[rank2]: frame #30: /root/miniconda3/bin/python3.11() [0x570874]
[rank2]: frame #31: _PyObject_FastCallDictTstate + 0x100 (0x485bd0 in /root/miniconda3/bin/python3.11)
[rank2]: frame #32: _PyObject_Call_Prepend + 0x13c (0x485eb0 in /root/miniconda3/bin/python3.11)
[rank2]: frame #33: /root/miniconda3/bin/python3.11() [0x4f7e20]
[rank2]: frame #34: /root/miniconda3/bin/python3.11() [0x4efed4]
[rank2]: frame #35: _PyObject_MakeTpCall + 0x98 (0x48595c in /root/miniconda3/bin/python3.11)
[rank2]: frame #36: _PyEval_EvalFrameDefault + 0x31c8 (0x429398 in /root/miniconda3/bin/python3.11)
[rank2]: frame #37: /root/miniconda3/bin/python3.11() [0x570874]
[rank2]: frame #38: PyEval_EvalCode + 0xa8 (0x570928 in /root/miniconda3/bin/python3.11)
[rank2]: frame #39: /root/miniconda3/bin/python3.11() [0x5b7dfc]
[rank2]: frame #40: /root/miniconda3/bin/python3.11() [0x5b8144]
[rank2]: frame #41: /root/miniconda3/bin/python3.11() [0x5b8274]
[rank2]: frame #42: _PyRun_SimpleFileObject + 0x144 (0x5bb3b4 in /root/miniconda3/bin/python3.11)
[rank2]: frame #43: _PyRun_AnyFileObject + 0x9c (0x5bb990 in /root/miniconda3/bin/python3.11)
[rank2]: frame #44: Py_RunMain + 0x7cc (0x5dbd6c in /root/miniconda3/bin/python3.11)
[rank2]: frame #45: Py_BytesMain + 0x64 (0x5dc3f4 in /root/miniconda3/bin/python3.11)
[rank2]: frame #46: + 0x276c4 (0xffffa15f76c4 in /lib64/libc.so.6)
[rank2]: frame #47: __libc_start_main + 0x98 (0xffffa15f77a8 in /lib64/libc.so.6)
[rank2]: frame #48: /root/miniconda3/bin/python3.11() [0x432440]

[ERROR] 2026-05-12-12:20:14 (PID:422, Device:4, RankID:-1) ERR99999 UNKNOWN applicaiton exception
[ERROR] 2026-05-12-12:20:14 (PID:421, Device:3, RankID:-1) ERR99999 UNKNOWN applicaiton exception
[ERROR] 2026-05-12-12:20:14 (PID:420, Device:2, RankID:-1) ERR99999 UNKNOWN applicaiton exception
[rank6]: Traceback (most recent call last):
[rank6]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/train/trainer.py", line 335, in
[rank6]: trainer = Trainer(args=args)
[rank6]: ^^^^^^^^^^^^^^^^^^
[rank6]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/train/trainer.py", line 71, in init
[rank6]: self.model = self.get_model(model_provider)
[rank6]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank6]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/train/trainer.py", line 179, in get_model
[rank6]: self.lora_weight_manager.verify_lora_weights()
[rank6]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/utils/lora_weight_manager.py", line 371, in verify_lora_weights
[rank6]: param_data = self._gather_dtensor(param.data) if self._is_dtensor(param.data) else param.data
[rank6]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank6]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/utils/lora_weight_manager.py", line 84, in _gather_dtensor
[rank6]: full_tensor = param_data.full_tensor()
[rank6]: ^^^^^^^^^^^^^^^^^^^^^^^^
[rank6]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_api.py", line 570, in full_tensor
[rank6]: redist_res = self.redistribute(
[rank6]: ^^^^^^^^^^^^^^^^^^
[rank6]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_api.py", line 542, in redistribute
[rank6]: return Redistribute.apply(self, device_mesh, placements, async_op)
[rank6]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank6]: File "/root/miniconda3/lib/python3.11/site-packages/torch/autograd/function.py", line 575, in apply
[rank6]: return super().apply(*args, **kwargs) # type: ignore[misc]
[rank6]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank6]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_redistribute.py", line 306, in forward
[rank6]: output = redistribute_local_tensor(
[rank6]: ^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank6]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_redistribute.py", line 213, in redistribute_local_tensor
[rank6]: new_local_tensor = current_placement._to_replicate_tensor(
[rank6]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank6]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/placement_types.py", line 260, in _to_replicate_tensor
[rank6]: result = funcol.all_gather_tensor(
[rank6]: ^^^^^^^^^^^^^^^^^^^^^^^^^
[rank6]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/_functional_collectives.py", line 205, in all_gather_tensor
[rank6]: tensor = torch.ops._c10d_functional.all_gather_into_tensor(
[rank6]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank6]: File "/root/miniconda3/lib/python3.11/site-packages/torch/_ops.py", line 1158, in call
[rank6]: return self._op(*args, (kwargs or {}))
[rank6]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank6]: RuntimeError: Backend hccl does not support allgather_into_tensor_coalesced
[rank6]: Exception raised from allgather_into_tensor_coalesced at /pytorch/torch/csrc/distributed/c10d/Backend.hpp:190 (most recent call first):
[rank6]: frame #0: c10::Error::Error(c10::SourceLocation, std::__cxx11::basic_string<char, std::char_traits, std::allocator >) + 0xd4 (0xffffa6943ea4 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libc10.so)
[rank6]: frame #1: c10::detail::torchCheckFail(char const
, char const
, unsigned int, std::__cxx11::basic_string<char, std::char_traits, std::allocator > const&) + 0xe4 (0xffffa68e3e44 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libc10.so)
[rank6]: frame #2: + 0x5d356f0 (0xffffac3056f0 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank6]: frame #3: + 0x5d5f9e8 (0xffffac32f9e8 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank6]: frame #4: + 0x5d6e26c (0xffffac33e26c in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank6]: frame #5: + 0x811a24 (0xffff8c451a24 in /root/miniconda3/lib/python3.11/site-packages/torch_npu/lib/libtorch_npu.so)
[rank6]: frame #6: + 0x5d834f8 (0xffffac3534f8 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank6]: frame #7: + 0x5d48730 (0xffffac318730 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank6]: frame #8: + 0x5d48b88 (0xffffac318b88 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank6]: frame #9: + 0x5d46ddc (0xffffac316ddc in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank6]: frame #10: + 0x811a24 (0xffff8c451a24 in /root/miniconda3/lib/python3.11/site-packages/torch_npu/lib/libtorch_npu.so)
[rank6]: frame #11: + 0x5c29be4 (0xffffac1f9be4 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank6]: frame #12: torch::jit::invokeOperatorFromPython(std::vector<std::shared_ptrtorch::jit::Operator, std::allocator<std::shared_ptrtorch::jit::Operator > > const&, pybind11::args const&, pybind11::kwargs const&, std::optionalc10::DispatchKey) + 0x140 (0xffffb144bb50 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank6]: frame #13: torch::jit::_get_operation_for_overload_or_packet(std::vector<std::shared_ptrtorch::jit::Operator, std::allocator<std::shared_ptrtorch::jit::Operator > > const&, c10::Symbol, pybind11::args const&, pybind11::kwargs const&, bool, std::optionalc10::DispatchKey) + 0x1dc (0xffffb144bdac in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank6]: frame #14: + 0xb3cf44 (0xffffb134cf44 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank6]: frame #15: + 0x588f5c (0xffffb0d98f5c in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank6]: frame #16: /root/miniconda3/bin/python3.11() [0x4d1e68]
[rank6]: frame #17: _PyObject_Call + 0x68 (0x485728 in /root/miniconda3/bin/python3.11)
[rank6]: frame #18: _PyEval_EvalFrameDefault + 0x4b64 (0x42ad34 in /root/miniconda3/bin/python3.11)
[rank6]: frame #19: /root/miniconda3/bin/python3.11() [0x570874]
[rank6]: frame #20: _PyObject_FastCallDictTstate + 0x7c (0x485b4c in /root/miniconda3/bin/python3.11)
[rank6]: frame #21: _PyObject_Call_Prepend + 0x13c (0x485eb0 in /root/miniconda3/bin/python3.11)
[rank6]: frame #22: /root/miniconda3/bin/python3.11() [0x4f7c98]
[rank6]: frame #23: _PyObject_MakeTpCall + 0x98 (0x48595c in /root/miniconda3/bin/python3.11)
[rank6]: frame #24: _PyEval_EvalFrameDefault + 0x31c8 (0x429398 in /root/miniconda3/bin/python3.11)
[rank6]: frame #25: /root/miniconda3/bin/python3.11() [0x570874]
[rank6]: frame #26: + 0x9e6610 (0xffffb11f6610 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank6]: frame #27: /root/miniconda3/bin/python3.11() [0x4d1e38]
[rank6]: frame #28: _PyObject_Call + 0x68 (0x485728 in /root/miniconda3/bin/python3.11)
[rank6]: frame #29: _PyEval_EvalFrameDefault + 0x4b64 (0x42ad34 in /root/miniconda3/bin/python3.11)
[rank6]: frame #30: /root/miniconda3/bin/python3.11() [0x570874]
[rank6]: frame #31: _PyObject_FastCallDictTstate + 0x100 (0x485bd0 in /root/miniconda3/bin/python3.11)
[rank6]: frame #32: _PyObject_Call_Prepend + 0x13c (0x485eb0 in /root/miniconda3/bin/python3.11)
[rank6]: frame #33: /root/miniconda3/bin/python3.11() [0x4f7e20]
[rank6]: frame #34: /root/miniconda3/bin/python3.11() [0x4efed4]
[rank6]: frame #35: _PyObject_MakeTpCall + 0x98 (0x48595c in /root/miniconda3/bin/python3.11)
[rank6]: frame #36: _PyEval_EvalFrameDefault + 0x31c8 (0x429398 in /root/miniconda3/bin/python3.11)
[rank6]: frame #37: /root/miniconda3/bin/python3.11() [0x570874]
[rank6]: frame #38: PyEval_EvalCode + 0xa8 (0x570928 in /root/miniconda3/bin/python3.11)
[rank6]: frame #39: /root/miniconda3/bin/python3.11() [0x5b7dfc]
[rank6]: frame #40: /root/miniconda3/bin/python3.11() [0x5b8144]
[rank6]: frame #41: /root/miniconda3/bin/python3.11() [0x5b8274]
[rank6]: frame #42: _PyRun_SimpleFileObject + 0x144 (0x5bb3b4 in /root/miniconda3/bin/python3.11)
[rank6]: frame #43: _PyRun_AnyFileObject + 0x9c (0x5bb990 in /root/miniconda3/bin/python3.11)
[rank6]: frame #44: Py_RunMain + 0x7cc (0x5dbd6c in /root/miniconda3/bin/python3.11)
[rank6]: frame #45: Py_BytesMain + 0x64 (0x5dc3f4 in /root/miniconda3/bin/python3.11)
[rank6]: frame #46: + 0x276c4 (0xffffb2a076c4 in /lib64/libc.so.6)
[rank6]: frame #47: __libc_start_main + 0x98 (0xffffb2a077a8 in /lib64/libc.so.6)
[rank6]: frame #48: /root/miniconda3/bin/python3.11() [0x432440]

[rank0]: Traceback (most recent call last):
[rank0]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/train/trainer.py", line 335, in
[rank0]: trainer = Trainer(args=args)
[rank0]: ^^^^^^^^^^^^^^^^^^
[rank0]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/train/trainer.py", line 71, in init
[rank0]: self.model = self.get_model(model_provider)
[rank0]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/train/trainer.py", line 179, in get_model
[rank0]: self.lora_weight_manager.verify_lora_weights()
[rank0]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/utils/lora_weight_manager.py", line 371, in verify_lora_weights
[rank0]: param_data = self._gather_dtensor(param.data) if self._is_dtensor(param.data) else param.data
[rank0]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]: File "/data/work/git/MindSpeed-MM/mindspeed_mm/fsdp/utils/lora_weight_manager.py", line 84, in _gather_dtensor
[rank0]: full_tensor = param_data.full_tensor()
[rank0]: ^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_api.py", line 570, in full_tensor
[rank0]: redist_res = self.redistribute(
[rank0]: ^^^^^^^^^^^^^^^^^^
[rank0]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_api.py", line 542, in redistribute
[rank0]: return Redistribute.apply(self, device_mesh, placements, async_op)
[rank0]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]: File "/root/miniconda3/lib/python3.11/site-packages/torch/autograd/function.py", line 575, in apply
[rank0]: return super().apply(*args, **kwargs) # type: ignore[misc]
[rank0]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_redistribute.py", line 306, in forward
[rank0]: output = redistribute_local_tensor(
[rank0]: ^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/_redistribute.py", line 213, in redistribute_local_tensor
[rank0]: new_local_tensor = current_placement._to_replicate_tensor(
[rank0]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/tensor/placement_types.py", line 260, in _to_replicate_tensor
[rank0]: result = funcol.all_gather_tensor(
[rank0]: ^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]: File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/_functional_collectives.py", line 205, in all_gather_tensor
[rank0]: tensor = torch.ops._c10d_functional.all_gather_into_tensor(
[rank0]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]: File "/root/miniconda3/lib/python3.11/site-packages/torch/_ops.py", line 1158, in call
[rank0]: return self._op(*args, (kwargs or {}))
[rank0]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]: RuntimeError: Backend hccl does not support allgather_into_tensor_coalesced
[rank0]: Exception raised from allgather_into_tensor_coalesced at /pytorch/torch/csrc/distributed/c10d/Backend.hpp:190 (most recent call first):
[rank0]: frame #0: c10::Error::Error(c10::SourceLocation, std::__cxx11::basic_string<char, std::char_traits, std::allocator >) + 0xd4 (0xffff9d0f3ea4 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libc10.so)
[rank0]: frame #1: c10::detail::torchCheckFail(char const
, char const
, unsigned int, std::__cxx11::basic_string<char, std::char_traits, std::allocator > const&) + 0xe4 (0xffff9d093e44 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libc10.so)
[rank0]: frame #2: + 0x5d356f0 (0xffffa2ab56f0 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank0]: frame #3: + 0x5d5f9e8 (0xffffa2adf9e8 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank0]: frame #4: + 0x5d6e26c (0xffffa2aee26c in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank0]: frame #5: + 0x811a24 (0xffff82c01a24 in /root/miniconda3/lib/python3.11/site-packages/torch_npu/lib/libtorch_npu.so)
[rank0]: frame #6: + 0x5d834f8 (0xffffa2b034f8 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank0]: frame #7: + 0x5d48730 (0xffffa2ac8730 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank0]: frame #8: + 0x5d48b88 (0xffffa2ac8b88 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank0]: frame #9: + 0x5d46ddc (0xffffa2ac6ddc in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank0]: frame #10: + 0x811a24 (0xffff82c01a24 in /root/miniconda3/lib/python3.11/site-packages/torch_npu/lib/libtorch_npu.so)
[rank0]: frame #11: + 0x5c29be4 (0xffffa29a9be4 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_cpu.so)
[rank0]: frame #12: torch::jit::invokeOperatorFromPython(std::vector<std::shared_ptrtorch::jit::Operator, std::allocator<std::shared_ptrtorch::jit::Operator > > const&, pybind11::args const&, pybind11::kwargs const&, std::optionalc10::DispatchKey) + 0x140 (0xffffa7bfbb50 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank0]: frame #13: torch::jit::_get_operation_for_overload_or_packet(std::vector<std::shared_ptrtorch::jit::Operator, std::allocator<std::shared_ptrtorch::jit::Operator > > const&, c10::Symbol, pybind11::args const&, pybind11::kwargs const&, bool, std::optionalc10::DispatchKey) + 0x1dc (0xffffa7bfbdac in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank0]: frame #14: + 0xb3cf44 (0xffffa7afcf44 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank0]: frame #15: + 0x588f5c (0xffffa7548f5c in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank0]: frame #16: /root/miniconda3/bin/python3.11() [0x4d1e68]
[rank0]: frame #17: _PyObject_Call + 0x68 (0x485728 in /root/miniconda3/bin/python3.11)
[rank0]: frame #18: _PyEval_EvalFrameDefault + 0x4b64 (0x42ad34 in /root/miniconda3/bin/python3.11)
[rank0]: frame #19: /root/miniconda3/bin/python3.11() [0x570874]
[rank0]: frame #20: _PyObject_FastCallDictTstate + 0x7c (0x485b4c in /root/miniconda3/bin/python3.11)
[rank0]: frame #21: _PyObject_Call_Prepend + 0x13c (0x485eb0 in /root/miniconda3/bin/python3.11)
[rank0]: frame #22: /root/miniconda3/bin/python3.11() [0x4f7c98]
[rank0]: frame #23: _PyObject_MakeTpCall + 0x98 (0x48595c in /root/miniconda3/bin/python3.11)
[rank0]: frame #24: _PyEval_EvalFrameDefault + 0x31c8 (0x429398 in /root/miniconda3/bin/python3.11)
[rank0]: frame #25: /root/miniconda3/bin/python3.11() [0x570874]
[rank0]: frame #26: + 0x9e6610 (0xffffa79a6610 in /root/miniconda3/lib/python3.11/site-packages/torch/lib/libtorch_python.so)
[rank0]: frame #27: /root/miniconda3/bin/python3.11() [0x4d1e38]
[rank0]: frame #28: _PyObject_Call + 0x68 (0x485728 in /root/miniconda3/bin/python3.11)
[rank0]: frame #29: _PyEval_EvalFrameDefault + 0x4b64 (0x42ad34 in /root/miniconda3/bin/python3.11)
[rank0]: frame #30: /root/miniconda3/bin/python3.11() [0x570874]
[rank0]: frame #31: _PyObject_FastCallDictTstate + 0x100 (0x485bd0 in /root/miniconda3/bin/python3.11)
[rank0]: frame #32: _PyObject_Call_Prepend + 0x13c (0x485eb0 in /root/miniconda3/bin/python3.11)
[rank0]: frame #33: /root/miniconda3/bin/python3.11() [0x4f7e20]
[rank0]: frame #34: /root/miniconda3/bin/python3.11() [0x4efed4]
[rank0]: frame #35: _PyObject_MakeTpCall + 0x98 (0x48595c in /root/miniconda3/bin/python3.11)
[rank0]: frame #36: _PyEval_EvalFrameDefault + 0x31c8 (0x429398 in /root/miniconda3/bin/python3.11)
[rank0]: frame #37: /root/miniconda3/bin/python3.11() [0x570874]
[rank0]: frame #38: PyEval_EvalCode + 0xa8 (0x570928 in /root/miniconda3/bin/python3.11)
[rank0]: frame #39: /root/miniconda3/bin/python3.11() [0x5b7dfc]
[rank0]: frame #40: /root/miniconda3/bin/python3.11() [0x5b8144]
[rank0]: frame #41: /root/miniconda3/bin/python3.11() [0x5b8274]
[rank0]: frame #42: _PyRun_SimpleFileObject + 0x144 (0x5bb3b4 in /root/miniconda3/bin/python3.11)
[rank0]: frame #43: _PyRun_AnyFileObject + 0x9c (0x5bb990 in /root/miniconda3/bin/python3.11)
[rank0]: frame #44: Py_RunMain + 0x7cc (0x5dbd6c in /root/miniconda3/bin/python3.11)
[rank0]: frame #45: Py_BytesMain + 0x64 (0x5dc3f4 in /root/miniconda3/bin/python3.11)
[rank0]: frame #46: + 0x276c4 (0xffffa91b76c4 in /lib64/libc.so.6)
[rank0]: frame #47: __libc_start_main + 0x98 (0xffffa91b77a8 in /lib64/libc.so.6)
[rank0]: frame #48: /root/miniconda3/bin/python3.11() [0x432440]

[ERROR] 2026-05-12-12:20:16 (PID:424, Device:6, RankID:-1) ERR99999 UNKNOWN applicaiton exception
W0512 12:20:17.016000 352 site-packages/torch/distributed/elastic/multiprocessing/api.py:900] Sending process 418 closing signal SIGTERM
W0512 12:20:17.018000 352 site-packages/torch/distributed/elastic/multiprocessing/api.py:900] Sending process 419 closing signal SIGTERM
W0512 12:20:17.021000 352 site-packages/torch/distributed/elastic/multiprocessing/api.py:900] Sending process 420 closing signal SIGTERM
W0512 12:20:17.022000 352 site-packages/torch/distributed/elastic/multiprocessing/api.py:900] Sending process 421 closing signal SIGTERM
W0512 12:20:17.022000 352 site-packages/torch/distributed/elastic/multiprocessing/api.py:900] Sending process 422 closing signal SIGTERM
W0512 12:20:17.022000 352 site-packages/torch/distributed/elastic/multiprocessing/api.py:900] Sending process 423 closing signal SIGTERM
W0512 12:20:17.024000 352 site-packages/torch/distributed/elastic/multiprocessing/api.py:900] Sending process 424 closing signal SIGTERM
E0512 12:20:20.809000 352 site-packages/torch/distributed/elastic/multiprocessing/api.py:874] failed (exitcode: 1) local_rank: 7 (pid: 425) of binary: /root/miniconda3/bin/python3.11
Traceback (most recent call last):
File "/root/miniconda3/bin/torchrun", line 7, in
sys.exit(main())
^^^^^^
File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/elastic/multiprocessing/errors/init.py", line 355, in wrapper
return f(*args, **kwargs)
^^^^^^^^^^^^^^^^^^
File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/run.py", line 892, in main
run(args)
File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/run.py", line 883, in run
elastic_launch(
File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 139, in call
return launch_agent(self._config, self._entrypoint, list(args))
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/root/miniconda3/lib/python3.11/site-packages/torch/distributed/launcher/api.py", line 270, in launch_agent
raise ChildFailedError(
torch.distributed.elastic.multiprocessing.errors.ChildFailedError:

mindspeed_mm/fsdp/train/trainer.py FAILED

Failures:
<NO_OTHER_FAILURES>

Root Cause (first observed failure):
[0]:
time : 2026-05-12_12:20:17
host : atomgit-0211-9
rank : 7 (local_rank: 7)
exitcode : 1 (pid: 425)
error_file: <N/A>
traceback : To enable traceback see: https://pytorch.org/docs/stable/elastic/errors.html

awk: cmd. line:1: BEGIN{printf "%.3f\n", *1000/}
awk: cmd. line:1: ^ syntax error
Elapsed Time Per iteration (ms):
Average Samples per Second:

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions