您好,感谢开源 Emotion-LLaMA-v2。
我们最近在复现论文 Table IV 里的 MER23 结果时遇到了一些对齐问题,想请教一下官方评测设置。
我们目前使用的是 Emotion-LLaMA-v2 stage2 checkpoint,在 MER2023 MER-MULTI/test1 上评测,共 411 条样本。按我们的理解,这一部分对应论文中的 MER23。输入文本使用的是 MMEVerse/MER2023 里的中文转写字段;peak frame 是用 OpenFace 提取 AU intensity 后,按每帧 AU*_r 求和取最大值;最后使用仓库里的 evaluation/score_hit_ov.py 计算 hit-rate。
目前我们复现到的 MER2023 test1 hit-rate 是 69.08,而论文 Table IV 中 Stage2 的 MER23 hit-rate 是 76.72。我们怀疑主要差异可能来自官方 evaluation CSV、prompt、peak-frame 文件或后处理流程没有完全对齐。
想请问是否方便提供或确认以下内容:
- Table IV 中 MER23 使用的官方 evaluation CSV / 样本列表,以及具体使用的文本字段;
- MER23 评测时使用的 prompt/template;
- OpenFace peak-frame 的生成方式,或者对应的
*_peak.json 文件;
- 从模型输出到 hit-rate 的完整评测命令或流程。
如果这些文件之后会统一发布,也希望能告知一下位置。谢谢!
您好,感谢开源 Emotion-LLaMA-v2。
我们最近在复现论文 Table IV 里的 MER23 结果时遇到了一些对齐问题,想请教一下官方评测设置。
我们目前使用的是 Emotion-LLaMA-v2 stage2 checkpoint,在 MER2023 MER-MULTI/test1 上评测,共 411 条样本。按我们的理解,这一部分对应论文中的 MER23。输入文本使用的是 MMEVerse/MER2023 里的中文转写字段;peak frame 是用 OpenFace 提取 AU intensity 后,按每帧
AU*_r求和取最大值;最后使用仓库里的evaluation/score_hit_ov.py计算 hit-rate。目前我们复现到的 MER2023 test1 hit-rate 是 69.08,而论文 Table IV 中 Stage2 的 MER23 hit-rate 是 76.72。我们怀疑主要差异可能来自官方 evaluation CSV、prompt、peak-frame 文件或后处理流程没有完全对齐。
想请问是否方便提供或确认以下内容:
*_peak.json文件;如果这些文件之后会统一发布,也希望能告知一下位置。谢谢!