Skip to content

[Bug]: 单次大模型调用耗时约 3.3 ~ 5.7 秒,时延过高,客户使用不可接受 #126

Description

Checklist

  • 我已经搜索过相关问题,但没有得到预期的帮助。
  • 最新版本中该错误尚未修复。
  • 请注意,如果您提交的Bug描述缺少相应的环境信息和最小可复现的demo,我们将很难复现和解决该问题,从而降低收到反馈的可能性,甚至该问题将被关闭。

🐞 问题详细描述

AssistantMessage response = model.invoke(
List.of(new UserMessage(prompt)),
null,
0.7f,
0.1f,
null,
512,
null,
null,
null,
Map.of()
);
这个调用耗时达到4s,客户环境达到10s,客户不可接受

详细的环境信息描述

模型:glm-5.2 @ https://ark.cn-beijing.volces.com/api/coding/v3
windows环境调用
调用参数: model.invoke(
List.of(new UserMessage(prompt)),
null,
0.7f,
0.1f,
null,
512,
null,
null,
null,
Map.of()

其他辅助信息

版本信息

感谢您的贡献 🎉!

Metadata

Metadata

Assignees

No one assigned

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions