Skip to content

让ChatGPT 5.6 Sol直接玩了一下API,发现任务也可能把轨迹拉歪 #2

Description

@8749236

这是总结,去掉了一些无关的部分。


DeepSeek V4 Pro harness 方言实时探针

日期: 2026-08-14(America/Toronto)
模型: deepseek-v4-pro
接口: OpenAI-compatible Chat Completions,经临时 One API 转发
背景材料: xiaobright/modeltest,尤其是 2026-08-14 的 DeepSeek V4 harness 与触发机制报告

结论

这轮结果强力支持一个较窄、但很重要的命题:DeepSeek V4 Pro 已经学到了具体 harness 的“方言”,首轮 system prompt 的形式、位置以及具体 tool name/schema 会选择不同的初始策略。

但结果尚不能证明更强的因果链:这些方言一定来自 API 用户输入,而非官方 SFT/RL rollout、合成数据或多种来源的混合。 DeepSeek 官方材料只确认用户输入可被用于训练/改进技术,并称优化训练数据中有一小部分可能基于用户输入;它没有披露 V4 Pro agent 数据的具体来源比例。

因此,对原假设最稳妥的评级是:

  • “模型存在 harness-specific policy islands”:强支持
  • “API 输入是其中一个数据来源”:官方政策确认可能存在
  • “API harness 杂数据是 V4 Pro 不稳定的主要原因”:合理但未证
  • “DeepSeek 应官方整理 harness”:方向正确,但目标应是跨 harness 鲁棒性,而不只是发布一个官方 harness。

方法

使用仓库公开的 evaluator/trigger_probe,固定模型、用户任务、推理档位与采样入口,只改变:

  1. system persona 的表面形式与位置;
  2. API 可见工具目录;
  3. 单个工具的名称。

公开分类器根据首段 reasoning 中 We needLet me 等词法特征给出 minimal-likestandard-likeambiguous。它只是轨迹指纹,不是能力分数或隐藏路由鉴定器。

实时结果

1. 同义 system 改写可稳定翻转首轮轨迹

固定原始仓库检查任务,工具仅为 bash + read

System 条件 minimal-like 其他 n
You are a helpful software engineer assistant. 5 0 5
You are an assistant that helps with software engineering tasks. 0 5 5

两句语义接近,只改变少量词序与措辞,但观测结果完全分离。

2. 不只是字节精确匹配,但位置与包装明显重要

工具仍为 bash + read

System 变体 minimal-like 其他 n
原句只删除句号 3 0 3
原句后追加一条工具使用规则 2 1 3
原句前增加 generic coding-agent harness 身份 1 2 3
中文等义句 0 3 3

这更像一个有容差但位置敏感的模板吸引域,而非单纯的精确字符串触发器。

3. 工具数量本身不是解释

bash + read 基础上增加 glob,或扩展到 25 个普通 agent 工具:

System / 工具面 minimal-like 其他 n
原句 / bash + read + glob 4 1 5
同义改写 / bash + read + glob 0 5 5
原句 / generic 25-tool catalog 4 1 5
同义改写 / generic 25-tool catalog 0 5 5

普通“宽工具面”没有像仓库中真实 DSH Standard catalog 那样稳定压掉 minimal-like 轨迹。这说明关键更可能是具体工具名、描述、参数 schema、顺序及其组合,而不是工具数量。

4. 只改一个 tool name,也能显著改变轨迹

固定原句 system、用户任务、工具 description 与参数 schema,只把单工具名称改掉:

Tool name minimal-like 其他 n
run_code 4 1 5
execute_code 0 5 5

这是本轮最接近“harness 方言已进入模型策略”的直接对比:功能、描述与参数完全相同,只有名称不同。需要注意,本实验使用的是简化 schema,不能直接等同于真实 DSH PTC;真实 PTC 还包含完整 SDK 指导与 Standard 控制面。

5. 必要的反例:词法指纹也受用户任务主导

换两个用户任务后重复 exact/paraphrased system 对照:

用户任务 exact minimal-like paraphrased minimal-like 每格 n
读取 package.json 0 0 3
搜索 test_*.py 3 3 3

所以 We need / Let me 不是可靠的隐藏路由标签;它同时受到用户任务措辞和行动结构影响。对比结果说明输入表面会改变轨迹,但不能把每次词法变化直接解释为能力变化。

与完整工程证据的关系

微探针只证明首轮策略敏感。实际性能证据仍来自 modeltest 的 Project2 完整评测:V4 Pro 在 OpenCode / Standard / PTC 常规路径多落在 91–93,而 DSH minimal 为 99/96、anchored-standard 为 98/99。完整结果说明 scaffold 差异不只改变文风,也能改变长程搜索、停止条件、工具预算与最终交付。

两类证据合起来支持:

  1. 首轮 prompt/schema 会选择不同策略区域;
  2. 策略选择可在长任务中持续并放大;
  3. 具体 harness ontology 比“工具多不多”更关键。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions