Skip to content

请问 MER23 复现所用的评测文件和 prompt 是否可以提供? #6

Description

@TianZhenK

您好,感谢开源 Emotion-LLaMA-v2。

我们最近在复现论文 Table IV 里的 MER23 结果时遇到了一些对齐问题,想请教一下官方评测设置。

我们目前使用的是 Emotion-LLaMA-v2 stage2 checkpoint,在 MER2023 MER-MULTI/test1 上评测,共 411 条样本。按我们的理解,这一部分对应论文中的 MER23。输入文本使用的是 MMEVerse/MER2023 里的中文转写字段;peak frame 是用 OpenFace 提取 AU intensity 后,按每帧 AU*_r 求和取最大值;最后使用仓库里的 evaluation/score_hit_ov.py 计算 hit-rate。

目前我们复现到的 MER2023 test1 hit-rate 是 69.08,而论文 Table IV 中 Stage2 的 MER23 hit-rate 是 76.72。我们怀疑主要差异可能来自官方 evaluation CSV、prompt、peak-frame 文件或后处理流程没有完全对齐。

想请问是否方便提供或确认以下内容:

  1. Table IV 中 MER23 使用的官方 evaluation CSV / 样本列表,以及具体使用的文本字段;
  2. MER23 评测时使用的 prompt/template;
  3. OpenFace peak-frame 的生成方式,或者对应的 *_peak.json 文件;
  4. 从模型输出到 hit-rate 的完整评测命令或流程。

如果这些文件之后会统一发布,也希望能告知一下位置。谢谢!

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions