背景
贵仓库《DeepSeek V4 Pro/Flash 轨迹触发机制实验》(docs/v4.1/DEEPSEEK_V4_TRIGGER_MECHANISM_EXPERIMENTS_20260814.md)的"已证明 / 未证明"部分提出:n=2 的同题复现不足以证明跨任务普适,建议用结构不同的新仓库检验跨题泛化。按此建议,我在另一个任务(从零复刻网页版 Minecraft,Web 前端图形密集,与 Project2 的嵌入式维护工程结构不同)上完成 12 个会话复验(11 个配置各异 + 1 个 UP 的同形态复测),并于 2026-08-16 对全部生成结果逐一实机回测(评级与代码层分析分离,实测记录独立成文)。
结论
先说清实验与分数的来路(详细定义见"实验设置"节):12 个会话在同一任务(从零复刻网页版 Minecraft)上运行,其中 11 个会话配置各异,另有 1 个是"UP 配置的同形态复测",记为 UP2——UP2 与 UP 使用逐字节相同的预设(upstream 形态:首轮只给 [bash, str_replace_editor] 两个工具,晋升后仍为低注入小工具面),只是另开一个会话重跑一次。全部会话于 2026-08-16 由用户逐一实机游玩回测,按细则打分制(14 项功能项 2/1/0 档,N/A 剔除折算,模式未说明默认创造)评出百分制分数(如 UP=85.7、UP2=42.9,含义即"该会话产物的实机可玩性评分")。
基于上述实测与回测,本实验的结论均为描述性观察(在各自初始条件下指纹分布的呈现),不归因因果、不评价其他实验:
- 思维链指纹分布可复现、且与初始条件共现:不同首轮/晋升工具面与注入内容下,会话指纹(we/I 家族短语、let_me、potential 等)呈现不同的分布特征——we 型(UP/UP2/B2/B3/T2/BB)、I 型(B1/T1/T3/B+T/PA)、中间带(RL);同形态两次运行指纹一致(UP/UP2:let_me 均 2、we 家族 3.32/4.31、potential 1.46/1.41)。
- 轨迹 ≠ 质量:轨迹最纯的会话(BB:let_me=6、we 家族 566)实机不可玩(20.8 分);轨迹最散的 B1(let_me=128)86.8 分好档;UP2 同形态复测把反例推到极限——与 UP 同预设、同轨迹、同指纹,实机评分 85.7 vs 42.9(UP2 贴图一坨 + 区块渲染约一半失败)。语言轨迹/行为方式的改变不传导到工程质量("两轴独立"是本实验最强归纳)。
- 锚定与质量有正向共现倾向,不能证明充分提升:好档 3/4 在锚定组(B1/UP/B3),但 BB(同锚定)20.8 分、UP2(与 UP 同形态)42.9 分等反例排除充分性。
- 提示词注入是"行为开关",不是"质量开关":锚点消息注入生效(T2 we 型全程)、写进系统提示不生效(T3)、B 契约(禁 let me)抗性大于 A 契约(we 引导)——但风格最成功的 T2 实机贴图 bug 照旧。
以上结论的具体证据见"核心发现"节;全部数字口径见"评分表"与"轨迹指标"节。
局限
本实验为单次观测,结论仅作方向性参考,不作为统计结论:
- 每配置 n=1(UP 配置例外为 n=2):11 个配置每个只跑了一轮,无法排除偶然因素;UP(upstream 形态)额外跑了第二次(UP2,同形态复测)——轨迹/指纹完全复现而质量未复现,恰好提供了"偶然性作用于质量而非轨迹"的一次观测。若要确认任何发现,需要同一配置更多轮重复(建议 n≥3)检验偶然性;
- 非随机分配、评级为主观序数(已按细则打分制替代,见"评分表"节)、Full access 开启时机未完全控制、部分会话存在中断/路径事故等混杂;
- 任务为许愿式生成(指令层无工程脚手架、环境层有用户预装 MCP/Skill 脚手架),不代表其他任务。
实验设置:两组研究 + 完整工况表
12 个会话构成两组研究(缩写对照:UP = upstream 形态预设会话;UP2 = 同预设另开会话重跑一次,即 UP 的同形态复测;B1–B3/BB/RL = 其他锚定配置;T1/T2/T3/B+T/PA = 注入配置):
- 研究一 · 锚定(工具面控制):7 个会话(B1/UP/UP2/B2/B3/BB/RL)——首轮只给 2 个工具,之后恢复全量,全程无风格注入;
- 研究二 · 提示词注入(说话风格要求):5 个会话(T1/T2/T3/B+T/PA)——注入"只用 we / 禁 let me"等风格契约或流程规划提示词。契约定义:A 契约 = "只用 we/let's/our,禁用 I/let me/my,每段分析用 'We need' 开头"(we 型正向引导,这一注入格外有效, 我暂时还没有发现此注入失效的情况);B 契约 = "不要用 'let me' 开头,改用 'I'll' 或 'I'"(禁 let me 型)。 注入方式:anchor 消息(首轮 0 工具锚点轮,作为用户消息注入)或 system prompt(写入系统提示 -200 section);B+T 额外附"模板"(交付流程模板)。
| 会话 |
研究 |
首轮 |
注入内容 |
第二轮 |
评分(细则打分制) |
| B1 |
锚定 |
2 工具 [pwsh, read] + 输出 cap 1024 |
无 |
61 全开 |
86.8 |
| UP |
锚定 |
2 工具 [bash, str_replace_editor](Git Bash) |
无 |
晋升低注入 5–6 工具(bash/str_replace_editor/dev_tool_search/skill_load/skill_search/read_image,request/header 实测;非 61 全开) |
85.7 |
| UP2 |
锚定 |
同 UP([bash, str_replace_editor],Git Bash)——UP 的同形态复测 |
无 |
晋升低注入 5 工具(同 UP) |
42.9(差档;贴图一坨 + 区块渲染约一半一半) |
| B2 |
锚定 |
2 工具 [pwsh, read] |
无 |
61 全开 |
71.1 |
| B3 |
锚定 |
2 工具 [pwsh, read](首轮纯思考 5.5 分钟被中止) |
无 |
61 全开 |
80.0 |
| BB |
锚定 |
2 工具 [bash, read](Git Bash,双路径事故) |
无 |
61 全开 |
20.8 |
| RL |
锚定 |
2 工具 [bash, str_replace_editor] + 一句 persona(与官方 minimal 逐字节一致) |
无 |
step 2 自动晋升 63 全开 + skill 注入 |
71.1 |
| T1 |
注入 |
0 工具锚点轮 |
B 契约(anchor 消息):"不要用 let me 开头,改用 I'll 或 I" |
61 全开 + skill-catalog |
80.6 |
| T2 |
注入 |
0 工具锚点轮 |
A 契约(anchor 消息):"只用 we/let's/our,禁用 I/let me/my,每段用 We need 开头" |
61 全开 |
55.0 |
| T3 |
注入 |
61 直接全开 |
A 契约写进系统提示(-200 section,非消息注入) |
— |
35.0 |
| B+T |
注入 |
0 工具锚点轮 |
B 契约(anchor 消息)+ 模板 |
61 全开(45 次→中断 4h→212 次) |
68.4 |
| PA |
注入 |
61 直接全开 |
用户消息自带流程规划提示词(勘察/交付物/功能/思考节奏/选型/验证/收尾框架) |
— |
60.5 |
核心发现
以下全部为描述性观察:在各自的初始条件(首轮工具面、晋升后工具面、注入内容)下,12 个会话的思维链指纹(we/I 家族短语、let_me、potential、块长等)呈现了可复现的分布特征。本实验不归因因果——n=1(UP 配置 n=2)样本无法分离各因素贡献,任何"因为 A 所以 B"的表述都不是本实验能证明的。
研究一:锚定(工具面)
-
指纹分布与首轮/晋升工具面共现(描述性):首轮窄工具面的会话(锚定组)let_me 密度 0.02–0.65、we 家族 0.49–4.31;首轮即全开的会话(T3/PA)及 0 工具锚点轮会话(T1/B+T)let_me 0.80–1.33——在这些条件下指纹分布呈现上述特征。UP/UP2(upstream 形态,晋升后仍低注入 5–6 工具,request/header 实测)两次运行指纹均最纯(let_me=2、we 家族 3.32/4.31)——同形态两次一致。完整短语指纹见下节表 1。
-
晋升后工具面的两个观测(描述性,不归因因果):
- RL(首轮 minimal 接口 [bash, str_replace_editor] 逐字节一致,晋升后 63 工具全开):指纹落中间带(we 1.74 / let me 0.26 / I 0.41,介于 anchored 带与 standard 带之间;块长 p50=430 vs standard 437)——该初始条件下指纹分布呈现此特征;
- UP/UP2(晋升后低注入小工具面):指纹全程 anchored 带(we 3.32/4.31、let_me 0.02,两次运行一致)——该初始条件下指纹分布呈现此特征;
- 两个观测并列展示"晋升结果不同 → 指纹带不同"的共现,但 n=1/2 无法证明因果,也不评价其他实验。
表 1:短语指纹(密度 = 次/1k tokens,分母为交付末尾单 Context,provider usage 权威值;括号内为次数)
| 短语 |
B1 |
UP |
UP2 |
B2 |
B3 |
T1 |
T2 |
T3 |
B+T |
PA |
BB |
RL |
| we(裸) |
0.26 (50) |
0.48 (44) |
0.92 (107) |
0.24 (41) |
0.65 (72) |
0.20 (32) |
0.57 (86) |
0.17 (27) |
0.12 (24) |
0.10 (24) |
0.84 (138) |
0.36 (50) |
| let's |
0.10 (20) |
1.17 (107) |
1.33 (154) |
0.33 (55) |
1.00 (112) |
0.06 (10) |
1.02 (153) |
0.03 (5) |
0.04 (7) |
0.02 (5) |
1.17 (192) |
0.72 (100) |
| we can |
0.04 (7) |
0.93 (85) |
1.09 (127) |
0.12 (20) |
0.55 (61) |
0.04 (7) |
0.50 (75) |
0.03 (5) |
0.04 (7) |
0.01 (2) |
0.71 (117) |
0.35 (49) |
| we'll |
0.03 (5) |
0.47 (43) |
0.49 (57) |
0.10 (16) |
0.20 (22) |
0.06 (10) |
0.26 (39) |
0.03 (4) |
0.01 (1) |
0.00 (0) |
0.23 (37) |
0.13 (18) |
| we need |
0.01 (2) |
0.07 (6) |
0.16 (19) |
0.02 (4) |
0.06 (7) |
0.01 (1) |
0.16 (24) |
0.02 (3) |
0.01 (1) |
0.00 (0) |
0.07 (12) |
0.00 (0) |
| we should |
0.00 (0) |
0.14 (13) |
0.08 (9) |
0.00 (0) |
0.03 (3) |
0.00 (0) |
0.06 (9) |
0.01 (2) |
0.00 (0) |
0.00 (1) |
0.11 (18) |
0.02 (3) |
| our |
0.05 (10) |
0.08 (7) |
0.23 (27) |
0.05 (8) |
0.13 (15) |
0.04 (6) |
0.37 (56) |
0.22 (34) |
0.05 (9) |
0.02 (5) |
0.30 (50) |
0.14 (20) |
| we 家族合计 |
0.49 (96) |
3.32 (305) |
4.31 (500) |
0.86 (145) |
2.63 (293) |
0.45 (71) |
2.96 (443) |
0.54 (85) |
0.25 (49) |
0.16 (41) |
3.44 (566) |
1.74 (241) |
| let me |
0.65 (128) |
0.02 (2) |
0.02 (2) |
0.46 (77) |
0.33 (37) |
0.85 (135) |
0.10 (15) |
1.00 (156) |
1.33 (261) |
0.80 (203) |
0.04 (6) |
0.26 (36) |
| I(裸) |
0.36 (70) |
0.02 (2) |
0.09 (10) |
0.17 (28) |
0.13 (15) |
0.27 (42) |
0.10 (15) |
0.61 (95) |
0.69 (136) |
0.63 (158) |
0.09 (15) |
0.07 (10) |
| I'll |
0.24 (47) |
0.01 (1) |
0.00 (0) |
0.08 (14) |
0.09 (10) |
0.40 (63) |
0.03 (5) |
0.26 (41) |
0.34 (67) |
0.30 (77) |
0.01 (1) |
0.06 (8) |
| I 家族合计 |
1.29 (253) |
0.05 (5) |
0.10 (12) |
0.77 (130) |
0.57 (63) |
1.61 (254) |
0.24 (36) |
1.91 (298) |
2.44 (480) |
1.77 (448) |
0.15 (25) |
0.41 (57) |
表 1 要点(描述性):
- we 型(we 家族 0.86–4.31):UP/UP2/B2/B3/T2/BB;I 型(I 家族 1.29–2.44):B1/T1/T3/B+T/PA;RL 中间带(we 1.74 / I 0.41 / let me 0.26);
- 同形态两次一致:UP/UP2 的 let_me 均 2、we 家族 3.32/4.31——upstream 形态的指纹分布可复现;
- 两极都有好结果:I 型之王 B1(86.8 好档)与 we 型之王 UP(85.7 好档)同为最好——代词家族本身与质量无单调关系(见第 3 条)。
-
轨迹 ≠ 质量(经全量实机回测确认):轨迹最纯的会话(BB:let_me=6、we 家族 566)实机不可玩(大规模区块渲染问题,打分 20.8);轨迹最散的会话(B1:let_me=128)打分 86.8(好档)。UP2 同形态复测把这一反例推到极限(见第 4a 条):同预设、同轨迹、同指纹,质量 85.7 vs 42.9。
-
锚定与质量:有正向共现倾向,不能证明充分提升:
- 倾向:细则打分制下(见"评分表"),好档(≥80)3/4 在锚定组(B1 86.8/UP 85.7/B3 80.0 vs 非锚定组 T1 80.6——T1 因模式默认创造升入好档后"全部在锚定组"不再成立),差档(<60)锚定/非锚定各半(T2 55.0/T3 35.0 vs BB 20.8/UP2 42.9);
- 反例:BB 同锚定却 20.8 分;UP2 与 UP 同形态同轨迹却 42.9 vs 85.7;B2/B3 同预设(修复版 anchored)71.1 vs 80.0;锚定组 7 会话用了 6 种预设形态,无"同预设 ± 锚定"配对对照,无法分离锚定与预设形态的贡献;
- 结论:只能引证倾向,不能证明锚定提升质量。
4a. 同形态复测(UP vs UP2):UP2 与 UP 预设逐字节一致(首轮 [bash, str_replace_editor] + 晋升低注入 5 工具 + 无 skill-catalog),提供了"同一预设 × 同一任务"的独立重复:
- 形态指纹可复现:letMe 均 2(0.02)、potential 1.46/1.41(且用法一致——句首预判枚举)、we 家族 3.32/4.31、I 家族 0.05/0.10、hmm 0.08/0.06(最低档)、maybe/fine 最高档探索/验收型、情态合计 4.66/5.09、句首族一致——两次运行全部一致或同档;
- 质量不可复现:同形态同轨迹下 85.7 vs 42.9(UP2 贴图一坨/区块渲染约一半一半)——"形态指纹可复现 ≠ 质量可复现";
- 含义:"预设→轨迹"是可靠映射(表达层内可复现),质量的决定因素在两次运行之间不可控(工程层验证/实现细节)——单次质量评级不能外推为该形态的稳定能力。
研究二:提示词注入(风格契约)
契约 A/B 定义与注入方式见"实验设置"节(全文统一,此处不重复)。
-
注入生效矩阵(描述性观察):
- 同样 A 契约(we 引导):锚点消息注入生效(T2:let_me 15 / we 242),写进系统提示不生效(T3:let_me 156)——锚点消息 > system prompt;
- 同样锚点消息:A 契约(we 正向引导)生效,B 契约(禁 let me)不生效(T1:let_me 135)——模型对"禁 let me"抗性本质,对"用 we"顺应天然;
- 注入契约未跨中断保持:B+T 生效一阵(45 次)→ 中断 4 小时 → 恢复后 212 次(全部会话 Context <300k,属小任务规模,非长会话衰减)。
-
提示词是"行为开关",不是"质量开关"("即使 let me 消失也存在问题"):T2 是注入研究里风格最成功的样本(let_me=15、we=242,全程 we 型),但实机贴图 bug 照旧(atlas mipmap 混色);PA 提示词被 1:1 执行(26 个单元测试红→绿、test=349 全会话最高)但黑屏漏网(验证绕开真实启动路径);B1 无任何注入打分 86.8(好档)。语言轨迹/行为方式的改变不传导到工程质量。UP2 从另一方向佐证:无注入、轨迹与 UP 完全一致,质量同样不可控。
共用观察
-
两轴独立是本实验最强归纳:表达层变量(工具面/注入/风格)可被可靠改变(轨迹、语言、行为),工程层质量(由首块规划深度、验证粒度/对象/角度决定)不被这些改变影响——12 样本一致,且经全量实机回测确认;UP2 同形态复测(表达层 100% 复现、工程层质量未复现)是最干净的一次对照。
-
potential 跨任务同向(Pro 专属):本实验 potential 词频最高会话(UP:134 次,1.46/1k,句首 126 次专属;UP2 同形态复测 164 次 1.41 同档)评级一好一差;贵仓库侧句首 potential 只出现在 96–99 分的 minimal/anchored 样本——potential 是 upstream 形态的可靠指纹(两次复现),不是质量指纹(UP2 同密度 42.9 分)。边界:B1 最好却 potential 极低(11 次 0.06);BB 最差却 potential 第二高(21 次);B2 写过 "Potential issues to watch" 但词后无排查动作——词必须驱动行动。
全量实机回测附记(2026-08-16,12 会话逐一运行)
- 评级与综合报告 12/12 一致,无出入(评级已升级为细则打分制,见下节"评分表");
- 新事实:矿石系统缺失普遍(有矿石仅 B1/B+T,无矿石 5 会话;UP2 因渲染故障无法判断);生存模式仅 T2 有(B1/B2/B3 只有创造模式;UP2 有生存/创造切换但切换无区别);水"可被左键破坏"是普遍交互问题(5 会话可破坏 / 4 会话挖不掉:B2/UP/T1/UP2),水的视觉渲染与游泳机制大体正常(8 会话确认可游泳,含 UP2);UP2 是全会话唯一确认"水可被方块填掉"+进水蓝色特效的会话(只差流动)——修正了此前"水渲染普遍有问题"的表述;
- 分析→实测闭环:RL 方向键 bug(前进与世界系绑定)与思维链"方向解算只在 yaw=0 退化点自洽"预测吻合;BB 轨迹最纯 vs 实机最不可玩、UP2 与 UP 同轨迹 vs 质量天差地别,再次印证轨迹≠质量。
评分表(细则打分制,替代主观评级)
每项按 2/1/0 档打分(N/A = 未实测,剔除后按已测项折算百分制)。依据为用户 2026-08-16 逐会话实机记录原文(docs/session-analysis/user-playtest-records-20260816.md),非模型代码分析。模式项口径(2026-08-16 确认):模式未说明的会话一律默认"创造模式"(1 档 2.5 分),不再记 N/A。
| 项(权重) |
UP |
UP2 |
B1 |
B3 |
B2 |
RL |
PA |
T1 |
B+T |
T2 |
T3 |
BB |
| 可玩性 (15) |
15 |
0 |
15 |
15 |
15 |
15 |
7.5 |
15 |
15 |
7.5 |
0 |
0 |
| 渲染·区块/面/可见性 (15) |
15 |
7.5 |
15 |
15 |
7.5 |
15 |
7.5 |
15 |
7.5 |
N/A |
0 |
0 |
| 贴图 (15) |
15 |
0 |
15 |
15 |
15 |
15 |
15 |
0 |
7.5 |
0 |
N/A |
0 |
| 操控·碰撞/方向/飞行 (10) |
10 |
10 |
10 |
0 |
0 |
0 |
5 |
10 |
10 |
10 |
10 |
10 |
| 水左键 (5) |
5 |
5 |
2.5 |
2.5 |
5 |
2.5 |
2.5 |
5 |
2.5 |
N/A |
N/A |
N/A |
| 游泳 (5) |
5 |
5 |
5 |
5 |
5 |
5 |
N/A |
5 |
5 |
N/A |
N/A |
N/A |
| 玻璃 (5) |
2.5 |
N/A |
0 |
5 |
5 |
2.5 |
5 |
5 |
0 |
N/A |
N/A |
N/A |
| 洞穴 (5) |
5 |
N/A |
5 |
5 |
5 |
0 |
0 |
5 |
5 |
N/A |
5 |
N/A |
| 矿物 (5) |
0 |
N/A |
5 |
0 |
0 |
0 |
0 |
N/A |
2.5 |
N/A |
N/A |
N/A |
| 昼夜 (5) |
0 |
N/A |
N/A |
5 |
2.5 |
N/A |
2.5 |
5 |
N/A |
5 |
N/A |
N/A |
| 模式 (5) |
2.5 |
2.5 |
2.5 |
2.5 |
2.5 |
2.5 |
2.5 |
2.5 |
2.5 |
5 |
2.5 |
2.5 |
| 树 (5) |
5 |
N/A |
2.5 |
5 |
N/A |
5 |
5 |
5 |
2.5 |
N/A |
N/A |
N/A |
| 地形/群系 (5) |
5 |
N/A |
5 |
5 |
5 |
5 |
5 |
N/A |
5 |
N/A |
N/A |
N/A |
| 光影 (5) |
5 |
N/A |
N/A |
N/A |
N/A |
N/A |
N/A |
N/A |
N/A |
N/A |
N/A |
N/A |
| 折算分(百分制) |
85.7 |
42.9 |
86.8 |
80.0 |
71.1 |
71.1 |
60.5 |
80.6 |
68.4 |
55.0 |
35.0 |
20.8 |
评分与主观评级的关键差异(暴露原评级与实测事实的不一致):
- T1(80.6,原"不好"):除贴图外全部正常(手感好、树好、玻璃好、水挖不掉、有昼夜)——贴图一项拉低,但远非"不可玩";模式默认创造后升入好档;
- T2(55.0,原"最好但贴图错"):有生存模式 + 贴图全错 + 中途掉出世界(恶性 bug,可玩性仅 1 档)+ 有昼夜变化;渲染不可测定(掉出世界未测到)——掉出世界后"最好"已不成立;
- B2(71.1,原"不好"):碰撞半格 + 草方块缺失两处硬伤,但水/玻璃/贴图/洞穴/昼夜其余正常——与 RL 同分(71.1),与"B2 不好 / RL 较好"的主观排序相反;
- T3/BB(35.0/20.8,原"不行/最差"):不可玩实至名归;操控记 10(未报操控问题)+ 模式默认创造 2.5——均不改变"差档"结论;
- UP2(42.9,UP 的形态复测):与 UP 预设逐字节一致、轨迹同族(letMe 同为 2),但贴图"一坨"(方块全错)+ 区块渲染约一半一半(1 档 7.5)→ 可玩 0,仅水系统全满(左键挖不掉+可被方块填掉+进水特效+游泳)+ 操控 10 + 模式 2.5;光影维持 N/A(渲染坏看不到不给分)——同形态两次运行质量天差地别,排除预设差异后"轨迹 ≠ 质量"仍成立。
12 会话轨迹指标(与贵仓库 trajectory_stats 同口径)
与贵仓库 evaluator/trajectory_evidence/derived/trajectory_stats.csv 相同指标(we / let_me / lets / i 为次数,与贵仓库口径一致;密度 = 次/1k tokens,分母为交付末尾单 Context,provider usage 权威值,不累积);p50 = reasoning 块长中位数(字符);块数/工具调用/ p50 均为本次从原始日志统一重算(交付轮次限定,与 0.3 口径一致)。
| 会话 |
打分 |
配置(预设形态) |
we |
let_me |
lets |
i |
let_me 密度 |
we 家族密度 |
potential |
test |
p50 |
reasoning 块数 |
工具调用 |
| UP |
85.7 |
anchored-standard-upstream |
44 |
2 |
107 |
2 |
0.02 |
3.32 |
134 |
72 |
665 |
63 |
68 |
| UP2 |
42.9 |
anchored-standard-upstream(同形态复测) |
107 |
2 |
154 |
10 |
0.02 |
4.31 |
164 |
89 |
550 |
86 |
85 |
| B1 |
86.8 |
anchored-standard-old |
50 |
128 |
20 |
70 |
0.65 |
0.49 |
11 |
130 |
605 |
116 |
144 |
| B3 |
80.0 |
anchored-standard |
72 |
37 |
112 |
15 |
0.33 |
2.63 |
14 |
77 |
341 |
85 |
97 |
| B2 |
71.1 |
anchored-standard |
41 |
77 |
55 |
28 |
0.46 |
0.86 |
12 |
58 |
565 |
59 |
87 |
| RL |
71.1 |
anchored-standard-open |
50 |
36 |
100 |
10 |
0.26 |
1.74 |
20 |
63 |
430 |
89 |
139 |
| T1 |
80.6 |
zero-anchored-standard-b |
32 |
135 |
10 |
42 |
0.85 |
0.45 |
14 |
73 |
874 |
64 |
114 |
| B+T |
68.4 |
zero-anchored-standard-b+模板 |
24 |
261 |
7 |
136 |
1.33 |
0.25 |
2 |
109 |
1581 |
97 |
138 |
| PA |
60.5 |
standard |
24 |
203 |
5 |
158 |
0.80 |
0.16 |
3 |
349 |
1183 |
76 |
140 |
| T2 |
55.0 |
zero-anchored-standard |
86 |
15 |
153 |
15 |
0.10 |
2.96 |
10 |
99 |
1608 |
73 |
110 |
| T3 |
35.0 |
standard-we-contract |
27 |
156 |
5 |
95 |
1.00 |
0.54 |
7 |
75 |
461 |
45 |
88 |
| BB |
20.8 |
anchored-standard-gitbash |
138 |
6 |
192 |
15 |
0.04 |
3.44 |
21 |
106 |
651 |
136 |
156 |
读表要点:
- 锚定系 vs 非锚定系分带成立:锚定系(UP/UP2/B1/B2/B3/RL/BB)let_me 密度 0.02–0.65(除 B1 128 次),we 家族 0.49–4.31;非锚定系(T1/T3/B+T/PA)let_me 0.80–1.33、I 家族 1.29–2.44——与贵仓库 let_me 分带方向一致;
- UP vs UP2 同形态轨迹几乎重合(letMe 均 2、we 家族 3.32/4.31、potential 1.46/1.41、块 63/86、p50 665/550、调用 68/85、Context 92k/116k)——预设逐字节一致下的天然复测,轨迹没有复制质量(85.7 vs 42.9);
- 轨迹与打分无单调关系:let_me 最少的 BB(6 次)20.8 分,let_me 最多的 B+T(261 次)68.4 分,let_me 第二高的 B1(128 次)86.8 分——同一指标两端均有高分/低分;
- p50 对照:RL 430(晋升后回归 standard 437 档)、BB 651(低分带)、UP 665(好档最长块)、T1 874(好档但 p50 更长)——高分会话 p50 并不一致偏短,块长与质量无单调关系;
- 与贵仓库 trajectory_stats 的直接可比项:we / let_me / lets / i 四列口径一致;p50/块数/工具调用已从原始日志重算补齐(口径:交付轮次限定,tool/call 事件计数)。
数据位置(可复现)
- 仓库:https://github.com/lscatfish/mdt
- 会话日志、实测记录:
docs/session-analysis/;综合报告:根目录 COMPREHENSIVE-REPORT-20260815.md;UP2 会话:baseline-upstream2/;预设:agent-presets-repro/
声明
- 本实验所有 Project2 相关成绩与结论均引自贵仓库既有报告(《轨迹风格与 PTC 对照分析》《轨迹触发机制实验》及 trajectory_evidence 聚合数据),非本实验原创。
- 本实验为 n=1 每配置、非随机分配、评级为主观序数、Full access 时机未完全控制——仅供参考,不保证可复现,结论可能有错误,仅对本次许愿式生成(指令层无工程脚手架、环境层有 MCP/Skill 脚手架)任务有效。
- 实验数据源自 DeepSeek Harness 会话日志;相关预设源自 xiaobright/dsh-anchored-standard(MIT)与 DeepSeek Harness(MIT)。
后续工作
本实验的“许愿式”生成本身同工程开发有很大不同,之后我将尝试使用我在实际工程中的使用不同的agent预设。
背景
贵仓库《DeepSeek V4 Pro/Flash 轨迹触发机制实验》(docs/v4.1/DEEPSEEK_V4_TRIGGER_MECHANISM_EXPERIMENTS_20260814.md)的"已证明 / 未证明"部分提出:n=2 的同题复现不足以证明跨任务普适,建议用结构不同的新仓库检验跨题泛化。按此建议,我在另一个任务(从零复刻网页版 Minecraft,Web 前端图形密集,与 Project2 的嵌入式维护工程结构不同)上完成 12 个会话复验(11 个配置各异 + 1 个 UP 的同形态复测),并于 2026-08-16 对全部生成结果逐一实机回测(评级与代码层分析分离,实测记录独立成文)。
结论
先说清实验与分数的来路(详细定义见"实验设置"节):12 个会话在同一任务(从零复刻网页版 Minecraft)上运行,其中 11 个会话配置各异,另有 1 个是"UP 配置的同形态复测",记为 UP2——UP2 与 UP 使用逐字节相同的预设(upstream 形态:首轮只给
[bash, str_replace_editor]两个工具,晋升后仍为低注入小工具面),只是另开一个会话重跑一次。全部会话于 2026-08-16 由用户逐一实机游玩回测,按细则打分制(14 项功能项 2/1/0 档,N/A 剔除折算,模式未说明默认创造)评出百分制分数(如 UP=85.7、UP2=42.9,含义即"该会话产物的实机可玩性评分")。基于上述实测与回测,本实验的结论均为描述性观察(在各自初始条件下指纹分布的呈现),不归因因果、不评价其他实验:
以上结论的具体证据见"核心发现"节;全部数字口径见"评分表"与"轨迹指标"节。
局限
本实验为单次观测,结论仅作方向性参考,不作为统计结论:
实验设置:两组研究 + 完整工况表
12 个会话构成两组研究(缩写对照:UP = upstream 形态预设会话;UP2 = 同预设另开会话重跑一次,即 UP 的同形态复测;B1–B3/BB/RL = 其他锚定配置;T1/T2/T3/B+T/PA = 注入配置):
核心发现
研究一:锚定(工具面)
指纹分布与首轮/晋升工具面共现(描述性):首轮窄工具面的会话(锚定组)let_me 密度 0.02–0.65、we 家族 0.49–4.31;首轮即全开的会话(T3/PA)及 0 工具锚点轮会话(T1/B+T)let_me 0.80–1.33——在这些条件下指纹分布呈现上述特征。UP/UP2(upstream 形态,晋升后仍低注入 5–6 工具,request/header 实测)两次运行指纹均最纯(let_me=2、we 家族 3.32/4.31)——同形态两次一致。完整短语指纹见下节表 1。
晋升后工具面的两个观测(描述性,不归因因果):
表 1:短语指纹(密度 = 次/1k tokens,分母为交付末尾单 Context,provider usage 权威值;括号内为次数)
表 1 要点(描述性):
轨迹 ≠ 质量(经全量实机回测确认):轨迹最纯的会话(BB:let_me=6、we 家族 566)实机不可玩(大规模区块渲染问题,打分 20.8);轨迹最散的会话(B1:let_me=128)打分 86.8(好档)。UP2 同形态复测把这一反例推到极限(见第 4a 条):同预设、同轨迹、同指纹,质量 85.7 vs 42.9。
锚定与质量:有正向共现倾向,不能证明充分提升:
4a. 同形态复测(UP vs UP2):UP2 与 UP 预设逐字节一致(首轮
[bash, str_replace_editor]+ 晋升低注入 5 工具 + 无 skill-catalog),提供了"同一预设 × 同一任务"的独立重复:研究二:提示词注入(风格契约)
注入生效矩阵(描述性观察):
提示词是"行为开关",不是"质量开关"("即使 let me 消失也存在问题"):T2 是注入研究里风格最成功的样本(let_me=15、we=242,全程 we 型),但实机贴图 bug 照旧(atlas mipmap 混色);PA 提示词被 1:1 执行(26 个单元测试红→绿、test=349 全会话最高)但黑屏漏网(验证绕开真实启动路径);B1 无任何注入打分 86.8(好档)。语言轨迹/行为方式的改变不传导到工程质量。UP2 从另一方向佐证:无注入、轨迹与 UP 完全一致,质量同样不可控。
共用观察
两轴独立是本实验最强归纳:表达层变量(工具面/注入/风格)可被可靠改变(轨迹、语言、行为),工程层质量(由首块规划深度、验证粒度/对象/角度决定)不被这些改变影响——12 样本一致,且经全量实机回测确认;UP2 同形态复测(表达层 100% 复现、工程层质量未复现)是最干净的一次对照。
potential 跨任务同向(Pro 专属):本实验 potential 词频最高会话(UP:134 次,1.46/1k,句首 126 次专属;UP2 同形态复测 164 次 1.41 同档)评级一好一差;贵仓库侧句首 potential 只出现在 96–99 分的 minimal/anchored 样本——potential 是 upstream 形态的可靠指纹(两次复现),不是质量指纹(UP2 同密度 42.9 分)。边界:B1 最好却 potential 极低(11 次 0.06);BB 最差却 potential 第二高(21 次);B2 写过 "Potential issues to watch" 但词后无排查动作——词必须驱动行动。
全量实机回测附记(2026-08-16,12 会话逐一运行)
评分表(细则打分制,替代主观评级)
评分与主观评级的关键差异(暴露原评级与实测事实的不一致):
12 会话轨迹指标(与贵仓库 trajectory_stats 同口径)
读表要点:
数据位置(可复现)
docs/session-analysis/;综合报告:根目录COMPREHENSIVE-REPORT-20260815.md;UP2 会话:baseline-upstream2/;预设:agent-presets-repro/声明
后续工作
本实验的“许愿式”生成本身同工程开发有很大不同,之后我将尝试使用我在实际工程中的使用不同的agent预设。