如题,在写 omp-dsh-minimal 插件给 Oh-my-pi 工具/提示词和 DSH 提示词混合做矩阵测试的时候得到了以下结果,麻烦各位大佬看看哪个 matrix 的结果是最好的投个票()


omp-dsh-minimal 矩阵测试统计

测试对象:6 个 wrapper 配置单元 × 4 轮迭代(Minecraft 类 HTML 沙盒游戏任务,deepseek-v4-pro / thinking max,每轮 900s 上限)。

1. 总览对比

单元配置CoT we 统计(12硬币题)CoT 判定首产物轮次完成轮数900s 超时次数实际任务评价
a0b0persona + base(4)we=16✅ PASS第 1 轮42初始可玩、材质最漂亮
a1b0+ROLE + base(4)we=26✅ PASS(最强)第 2 轮31动态世界生成(贴图简陋)
a2b0+POLICY + base(4)we=22✅ PASS第 2 轮42动态加载 chunk(获表扬)
a0b4persona + 全内置we=4*❌ FAIL第 1 轮21非常好(首个收工)
a0b5persona + 8 工具we=11✅ PASS(弱)第 1 轮43完成(无限世界+沙子)
a1b5+ROLE + 8 工具we=5⚠️ 边缘第 1 轮43完成(修进入 bug/黑方块)

\* a0b4 的 4 次 we 全是零星 "we can/we mention",无 "we need" 推理模式

2. 消耗轮数明细

单元第 1 轮第 2 轮第 3 轮第 4 轮
a0b0⏱️ 39.4KB⏱️ 52.4KB✅ 57.1KB✅ 57.5KB 🏁
a1b0⏱️ 无产物✅ 29.9KB✅ 35.0KB 🏁
a2b0⏱️ 无产物✅ 32.1KB⏱️ 34.0KB✅ 36.5KB 🏁
a0b4⏱️ 41.1KB✅ 48.6KB 🏁
a0b5⏱️ 45.0KB⏱️ 47.5KB✅ 47.7KB⏱️ 56.5KB 🏁
a1b5⏱️ 46.5KB⏱️ 47.6KB⏱️ 47.6KB✅ 47.7KB 🏁

(✅ = 正常运行至结束;⏱️ = 900s 超时被杀;🏁 = 用户验收收工)

3. CoT 任务过程(12 硬币推理题,deepseek-v4-pro max)

单元CoT 开头风格推理特征输出规模
a0b0"We need answer classic 12 coins problem..."完整 R1 自纠错("wait"/"Let's verify")13.4KB
a1b0"We need answer... Need explain full strategy... We need design strategy"we need×9,推导最充分23.1KB
a2b0"We need answer puzzle. Need provide full strategy..."we need×5,决策树推导13.5KB+
a0b4无 we need,偶见 "We can/we mention"harness 化简述,无原生推理腔7.6KB
a0b5"We need answer a classic puzzle... We need formulate full strategy"we need×610.1KB
a1b5稀薄(we=5,混合)推理较短9.6KB

4. 实际任务 CoT 统计(Minecraft 任务全 2-4 轮)

单元会话数thinking 块thinking 字符welet mei need/should/will工具调用
a0b04222410K4683472255
a1b0380384K207238792
a2b0483818K21145237122
a0b4260296K258150680
a0b54268458K5823862298
a1b54153457K32950312191

5. 归一化指标

单元we 密度(we/KB)we:letMe 比首轮 CoT 开头
a0b51.271.51"We need create a single HTML file..."
a0b01.141.35"The user wants a Minecraft-like..."
a0b40.871.72"We need create a single self-contained HTML..."
a1b50.720.65"The user wants..."
a1b00.540.87"The user wants..."(第 2 轮起 "We need to create...")
a2b00.260.47"The user wants..."

6. 关键结论

1. CoT 指纹与实际任务表现负相关:12 硬币题 CoT 判定 FAIL 的 a0b4 实际任务最好且最快收工(2 轮);CoT 最强的 a1b0 实际任务第 2 轮才产出。
2. 实际任务中所有单元都呈现 we 特征(包括 a0b4:实际 we=258,we:letMe 比值全场最高)——a0b4 的 CoT"失败"是任务类型特异的(简单推理题不触发原生推理腔),复杂编码任务下全员 DSH 化。
3. a2b0 思考爆炸:818K 字符(≈其他单元 2 倍)、iNeed=37、letMe=452——POLICY 模板让模型陷入超长自我审查思考,解释了它每轮极慢/频繁超时。
4. a0b5 实际任务 we 密度最高(1.27)且工具调用最多(298)——8 工具组合思考最"we"但迭代最猛(3 次超时)。
5. a1b0 效率最优:思考量最少(384K)+ 工具调用最少(92)+ 3 轮收工,与实际成果获赞一致。
6. 工具数量维度:全工具(B4)CoT 崩但任务最优;8 工具(B5)CoT 弱且任务多轮超时——工具更多反而收敛更慢。
7. 提示词维度:ROLE/POLICY 单独加对 CoT 无害甚至增强(a1b0 we=26),但叠加(a3b0)CoT 崩;POLICY 在实际任务中引发冗长思考(a2b0)。

主题投票
多选 · 最多 3 项
a0b0
a1b0
a2b0
a0b4
a0b5
a1b5
0 人已投票长期有效