在融合 oh-my-pi 和 dsh 提示词的时候测出了一些数据,麻烦各位大佬看看评估一下
- DeepslateQAQUID 2563小时前
如题,在写
omp-dsh-minimal插件给 Oh-my-pi 工具/提示词和 DSH 提示词混合做矩阵测试的时候得到了以下结果,麻烦各位大佬看看哪个 matrix 的结果是最好的投个票()omp-dsh-minimal 矩阵测试统计
测试对象:6 个 wrapper 配置单元 × 4 轮迭代(Minecraft 类 HTML 沙盒游戏任务,deepseek-v4-pro / thinking max,每轮 900s 上限)。
1. 总览对比
单元 配置 CoT we 统计(12硬币题) CoT 判定 首产物轮次 完成轮数 900s 超时次数 实际任务评价 a0b0 persona + base(4) we=16 ✅ PASS 第 1 轮 4 2 初始可玩、材质最漂亮 a1b0 +ROLE + base(4) we=26 ✅ PASS(最强) 第 2 轮 3 1 动态世界生成(贴图简陋) a2b0 +POLICY + base(4) we=22 ✅ PASS 第 2 轮 4 2 动态加载 chunk(获表扬) a0b4 persona + 全内置 we=4* ❌ FAIL 第 1 轮 2 1 非常好(首个收工) a0b5 persona + 8 工具 we=11 ✅ PASS(弱) 第 1 轮 4 3 完成(无限世界+沙子) a1b5 +ROLE + 8 工具 we=5 ⚠️ 边缘 第 1 轮 4 3 完成(修进入 bug/黑方块) \* a0b4 的 4 次 we 全是零星 "we can/we mention",无 "we need" 推理模式
2. 消耗轮数明细
单元 第 1 轮 第 2 轮 第 3 轮 第 4 轮 a0b0 ⏱️ 39.4KB ⏱️ 52.4KB ✅ 57.1KB ✅ 57.5KB 🏁 a1b0 ⏱️ 无产物 ✅ 29.9KB ✅ 35.0KB 🏁 — a2b0 ⏱️ 无产物 ✅ 32.1KB ⏱️ 34.0KB ✅ 36.5KB 🏁 a0b4 ⏱️ 41.1KB ✅ 48.6KB 🏁 — — a0b5 ⏱️ 45.0KB ⏱️ 47.5KB ✅ 47.7KB ⏱️ 56.5KB 🏁 a1b5 ⏱️ 46.5KB ⏱️ 47.6KB ⏱️ 47.6KB ✅ 47.7KB 🏁 (✅ = 正常运行至结束;⏱️ = 900s 超时被杀;🏁 = 用户验收收工)
3. CoT 任务过程(12 硬币推理题,deepseek-v4-pro max)
单元 CoT 开头风格 推理特征 输出规模 a0b0 "We need answer classic 12 coins problem..." 完整 R1 自纠错("wait"/"Let's verify") 13.4KB a1b0 "We need answer... Need explain full strategy... We need design strategy" we need×9,推导最充分 23.1KB a2b0 "We need answer puzzle. Need provide full strategy..." we need×5,决策树推导 13.5KB+ a0b4 无 we need,偶见 "We can/we mention" harness 化简述,无原生推理腔 7.6KB a0b5 "We need answer a classic puzzle... We need formulate full strategy" we need×6 10.1KB a1b5 稀薄(we=5,混合) 推理较短 9.6KB 4. 实际任务 CoT 统计(Minecraft 任务全 2-4 轮)
单元 会话数 thinking 块 thinking 字符 we let me i need/should/will 工具调用 a0b0 4 222 410K 468 347 2 255 a1b0 3 80 384K 207 238 7 92 a2b0 4 83 818K 211 452 37 122 a0b4 2 60 296K 258 150 6 80 a0b5 4 268 458K 582 386 2 298 a1b5 4 153 457K 329 503 12 191 5. 归一化指标
单元 we 密度(we/KB) we:letMe 比 首轮 CoT 开头 a0b5 1.27 1.51 "We need create a single HTML file..." a0b0 1.14 1.35 "The user wants a Minecraft-like..." a0b4 0.87 1.72 "We need create a single self-contained HTML..." a1b5 0.72 0.65 "The user wants..." a1b0 0.54 0.87 "The user wants..."(第 2 轮起 "We need to create...") a2b0 0.26 0.47 "The user wants..." 6. 关键结论
1. CoT 指纹与实际任务表现负相关:12 硬币题 CoT 判定 FAIL 的 a0b4 实际任务最好且最快收工(2 轮);CoT 最强的 a1b0 实际任务第 2 轮才产出。
2. 实际任务中所有单元都呈现 we 特征(包括 a0b4:实际 we=258,we:letMe 比值全场最高)——a0b4 的 CoT"失败"是任务类型特异的(简单推理题不触发原生推理腔),复杂编码任务下全员 DSH 化。
3. a2b0 思考爆炸:818K 字符(≈其他单元 2 倍)、iNeed=37、letMe=452——POLICY 模板让模型陷入超长自我审查思考,解释了它每轮极慢/频繁超时。
4. a0b5 实际任务 we 密度最高(1.27)且工具调用最多(298)——8 工具组合思考最"we"但迭代最猛(3 次超时)。
5. a1b0 效率最优:思考量最少(384K)+ 工具调用最少(92)+ 3 轮收工,与实际成果获赞一致。
6. 工具数量维度:全工具(B4)CoT 崩但任务最优;8 工具(B5)CoT 弱且任务多轮超时——工具更多反而收敛更慢。
7. 提示词维度:ROLE/POLICY 单独加对 CoT 无害甚至增强(a1b0 we=26),但叠加(a3b0)CoT 崩;POLICY 在实际任务中引发冗长思考(a2b0)。