118 Tool use_public.json
举个例子
{"Input": "在厨房里煮饭时,突然停电了。", "Output": "手摇发电机", "Instruction": "在这个任务中,你将扮演一个工具使用模型。你需要理解一个工具的功能和使用方法,并在特定的场景下使用它。你需要具备对工具的理解和推理能力,以便有效地使用工具。"}
提示词没给哪些工具,全靠模型自己猜,我发现通过的几个测试都是模型自己猜测了多个工具才猜对。
但这个任务下某些例子的答案就很不直觉,比如这个手摇发动机。
10_Textual_Entailment_public
{"Input": "美国电信巨头AT&T周三公布的季度净利润下降了近10%,但由于无线收入的大幅增长和苹果iPhone的业绩改善,业绩超出预期。该公司在一份声明中说,第一季度的净利润与去年同期相比下降了9.7%,为31.2亿美元,而收入下降了0.6%,为306亿美元。每股收益为53美分,好于华尔街分析师预期的每股48美分。\niPhone是AT&T的产品。", "Output": "1", "Instruction": "\"在这个任务中,你得到了两个句子。请指出第一句话是否明确包含第二句话(即,通过阅读第一句话可以得出第二句话的结论)。如果第一句话包含第二句话,请用'1'表示你的答案,否则用'0'回答。"}
这里提到的第一句和第二句,在Input中是用\n分割的,但模型会认为是用句号分割的
131
{"Input": "在一家公司中,有三个高管,分别是张先生、李女士和王先生。公司有三个部门,分别是人事部、财务部和市场部。根据以下条件,推断出每个高管负责哪个部门:\n1、张先生不负责市场部,也不在人事部工作。\n2、李女士不在财务部工作。\n3、王先生不负责人事部。", "Output": "推理过程:根据题目条件,可以列出以下表格:\n\n 人事部 \t财务部\t 市场部\n张先生\t×\t ×\t\n李女士\t\t ×\t ×\n王先生\t×\t\t ×\n其中,× 表示该高管负责该部门。\n\n根据条件 1,张先生不负责市场部,也不在人事部工作,因此张先生负责财务部。\n\n人事部\t财务部\t市场部\n张先生\t×\t✓\t\n李女士\t\t×\t×\n王先生\t×\t\t×\n根据条件 2,李女士不在财务部工作,因此李女士负责市场部。\n\n人事部\t财务部\t市场部\n张先生\t×\t✓\t\n李女士\t\t×\t✓\n王先生\t×\t\t×\n根据条件 3,王先生不负责人事部,因此王先生负责人事部。\n\n人事部\t财务部\t市场部\n张先生\t×\t✓\t\n李女士\t\t×\t✓\n王先生\t✓\t\t×\n\n结论:综上所述,张先生负责财务部,李女士负责市场部,王先生负责人事部。", "Instruction": "在这个任务中,你将扮演一个组合推理模型。你需要理解一个复杂的场景或问题,并使用组合推理规则来推断出正确的答案。你需要具备抽象思维和推理能力,以便能够有效地进行组合推理。"}
答案是王先生负责人事部, 但是题干是 3、王先生不负责人事部
互相矛盾.
还有很多, 列不过来
我是先用飞书表格的豆包跑了一遍, 豆包做错的再用DeepSeek跑一边, 剩下做错很多都有争议,甚至不应该作为评测数据
(数据标注师是外包的吧, 😂)
118 Tool use_public.json
举个例子
提示词没给哪些工具,全靠模型自己猜,我发现通过的几个测试都是模型自己猜测了多个工具才猜对。
但这个任务下某些例子的答案就很不直觉,比如这个手摇发动机。
10_Textual_Entailment_public
这里提到的第一句和第二句,在
Input中是用\n分割的,但模型会认为是用句号分割的131
答案是
王先生负责人事部, 但是题干是3、王先生不负责人事部互相矛盾.
还有很多, 列不过来
我是先用飞书表格的豆包跑了一遍, 豆包做错的再用DeepSeek跑一边, 剩下做错很多都有争议,甚至不应该作为评测数据
(数据标注师是外包的吧, 😂)