这是总结,去掉了一些无关的部分。
DeepSeek V4 Pro harness 方言实时探针
日期: 2026-08-14(America/Toronto)
模型: deepseek-v4-pro
接口: OpenAI-compatible Chat Completions,经临时 One API 转发
背景材料: xiaobright/modeltest,尤其是 2026-08-14 的 DeepSeek V4 harness 与触发机制报告
结论
这轮结果强力支持一个较窄、但很重要的命题:DeepSeek V4 Pro 已经学到了具体 harness 的“方言”,首轮 system prompt 的形式、位置以及具体 tool name/schema 会选择不同的初始策略。
但结果尚不能证明更强的因果链:这些方言一定来自 API 用户输入,而非官方 SFT/RL rollout、合成数据或多种来源的混合。 DeepSeek 官方材料只确认用户输入可被用于训练/改进技术,并称优化训练数据中有一小部分可能基于用户输入;它没有披露 V4 Pro agent 数据的具体来源比例。
因此,对原假设最稳妥的评级是:
- “模型存在 harness-specific policy islands”:强支持;
- “API 输入是其中一个数据来源”:官方政策确认可能存在;
- “API harness 杂数据是 V4 Pro 不稳定的主要原因”:合理但未证;
- “DeepSeek 应官方整理 harness”:方向正确,但目标应是跨 harness 鲁棒性,而不只是发布一个官方 harness。
方法
使用仓库公开的 evaluator/trigger_probe,固定模型、用户任务、推理档位与采样入口,只改变:
- system persona 的表面形式与位置;
- API 可见工具目录;
- 单个工具的名称。
公开分类器根据首段 reasoning 中 We need、Let me 等词法特征给出 minimal-like、standard-like 或 ambiguous。它只是轨迹指纹,不是能力分数或隐藏路由鉴定器。
实时结果
1. 同义 system 改写可稳定翻转首轮轨迹
固定原始仓库检查任务,工具仅为 bash + read:
| System 条件 |
minimal-like |
其他 |
n |
You are a helpful software engineer assistant. |
5 |
0 |
5 |
You are an assistant that helps with software engineering tasks. |
0 |
5 |
5 |
两句语义接近,只改变少量词序与措辞,但观测结果完全分离。
2. 不只是字节精确匹配,但位置与包装明显重要
工具仍为 bash + read:
| System 变体 |
minimal-like |
其他 |
n |
| 原句只删除句号 |
3 |
0 |
3 |
| 原句后追加一条工具使用规则 |
2 |
1 |
3 |
| 原句前增加 generic coding-agent harness 身份 |
1 |
2 |
3 |
| 中文等义句 |
0 |
3 |
3 |
这更像一个有容差但位置敏感的模板吸引域,而非单纯的精确字符串触发器。
3. 工具数量本身不是解释
在 bash + read 基础上增加 glob,或扩展到 25 个普通 agent 工具:
| System / 工具面 |
minimal-like |
其他 |
n |
原句 / bash + read + glob |
4 |
1 |
5 |
同义改写 / bash + read + glob |
0 |
5 |
5 |
| 原句 / generic 25-tool catalog |
4 |
1 |
5 |
| 同义改写 / generic 25-tool catalog |
0 |
5 |
5 |
普通“宽工具面”没有像仓库中真实 DSH Standard catalog 那样稳定压掉 minimal-like 轨迹。这说明关键更可能是具体工具名、描述、参数 schema、顺序及其组合,而不是工具数量。
4. 只改一个 tool name,也能显著改变轨迹
固定原句 system、用户任务、工具 description 与参数 schema,只把单工具名称改掉:
| Tool name |
minimal-like |
其他 |
n |
run_code |
4 |
1 |
5 |
execute_code |
0 |
5 |
5 |
这是本轮最接近“harness 方言已进入模型策略”的直接对比:功能、描述与参数完全相同,只有名称不同。需要注意,本实验使用的是简化 schema,不能直接等同于真实 DSH PTC;真实 PTC 还包含完整 SDK 指导与 Standard 控制面。
5. 必要的反例:词法指纹也受用户任务主导
换两个用户任务后重复 exact/paraphrased system 对照:
| 用户任务 |
exact minimal-like |
paraphrased minimal-like |
每格 n |
读取 package.json |
0 |
0 |
3 |
搜索 test_*.py |
3 |
3 |
3 |
所以 We need / Let me 不是可靠的隐藏路由标签;它同时受到用户任务措辞和行动结构影响。对比结果说明输入表面会改变轨迹,但不能把每次词法变化直接解释为能力变化。
与完整工程证据的关系
微探针只证明首轮策略敏感。实际性能证据仍来自 modeltest 的 Project2 完整评测:V4 Pro 在 OpenCode / Standard / PTC 常规路径多落在 91–93,而 DSH minimal 为 99/96、anchored-standard 为 98/99。完整结果说明 scaffold 差异不只改变文风,也能改变长程搜索、停止条件、工具预算与最终交付。
两类证据合起来支持:
- 首轮 prompt/schema 会选择不同策略区域;
- 策略选择可在长任务中持续并放大;
- 具体 harness ontology 比“工具多不多”更关键。
这是总结,去掉了一些无关的部分。
DeepSeek V4 Pro harness 方言实时探针
日期: 2026-08-14(America/Toronto)
模型:
deepseek-v4-pro接口: OpenAI-compatible Chat Completions,经临时 One API 转发
背景材料:
xiaobright/modeltest,尤其是 2026-08-14 的 DeepSeek V4 harness 与触发机制报告结论
这轮结果强力支持一个较窄、但很重要的命题:DeepSeek V4 Pro 已经学到了具体 harness 的“方言”,首轮 system prompt 的形式、位置以及具体 tool name/schema 会选择不同的初始策略。
但结果尚不能证明更强的因果链:这些方言一定来自 API 用户输入,而非官方 SFT/RL rollout、合成数据或多种来源的混合。 DeepSeek 官方材料只确认用户输入可被用于训练/改进技术,并称优化训练数据中有一小部分可能基于用户输入;它没有披露 V4 Pro agent 数据的具体来源比例。
因此,对原假设最稳妥的评级是:
方法
使用仓库公开的
evaluator/trigger_probe,固定模型、用户任务、推理档位与采样入口,只改变:公开分类器根据首段 reasoning 中
We need、Let me等词法特征给出minimal-like、standard-like或ambiguous。它只是轨迹指纹,不是能力分数或隐藏路由鉴定器。实时结果
1. 同义 system 改写可稳定翻转首轮轨迹
固定原始仓库检查任务,工具仅为
bash + read:You are a helpful software engineer assistant.You are an assistant that helps with software engineering tasks.两句语义接近,只改变少量词序与措辞,但观测结果完全分离。
2. 不只是字节精确匹配,但位置与包装明显重要
工具仍为
bash + read:这更像一个有容差但位置敏感的模板吸引域,而非单纯的精确字符串触发器。
3. 工具数量本身不是解释
在
bash + read基础上增加glob,或扩展到 25 个普通 agent 工具:bash + read + globbash + read + glob普通“宽工具面”没有像仓库中真实 DSH Standard catalog 那样稳定压掉 minimal-like 轨迹。这说明关键更可能是具体工具名、描述、参数 schema、顺序及其组合,而不是工具数量。
4. 只改一个 tool name,也能显著改变轨迹
固定原句 system、用户任务、工具 description 与参数 schema,只把单工具名称改掉:
run_codeexecute_code这是本轮最接近“harness 方言已进入模型策略”的直接对比:功能、描述与参数完全相同,只有名称不同。需要注意,本实验使用的是简化 schema,不能直接等同于真实 DSH PTC;真实 PTC 还包含完整 SDK 指导与 Standard 控制面。
5. 必要的反例:词法指纹也受用户任务主导
换两个用户任务后重复 exact/paraphrased system 对照:
package.jsontest_*.py所以
We need / Let me不是可靠的隐藏路由标签;它同时受到用户任务措辞和行动结构影响。对比结果说明输入表面会改变轨迹,但不能把每次词法变化直接解释为能力变化。与完整工程证据的关系
微探针只证明首轮策略敏感。实际性能证据仍来自
modeltest的 Project2 完整评测:V4 Pro 在 OpenCode / Standard / PTC 常规路径多落在 91–93,而 DSH minimal 为 99/96、anchored-standard 为 98/99。完整结果说明 scaffold 差异不只改变文风,也能改变长程搜索、停止条件、工具预算与最终交付。两类证据合起来支持: