在融合 oh-my-pi 和 dsh 提示词的时候测出了一些数据,麻烦各位大佬看看评估一下

1353
  • DeepslateQAQ

    如题,在写 omp-dsh-minimal 插件给 Oh-my-pi 工具/提示词和 DSH 提示词混合做矩阵测试的时候得到了以下结果,麻烦各位大佬看看哪个 matrix 的结果是最好的投个票()


    omp-dsh-minimal 矩阵测试统计

    测试对象:6 个 wrapper 配置单元 × 4 轮迭代(Minecraft 类 HTML 沙盒游戏任务,deepseek-v4-pro / thinking max,每轮 900s 上限)。

    1. 总览对比

    单元配置CoT we 统计(12硬币题)CoT 判定首产物轮次完成轮数900s 超时次数实际任务评价
    a0b0persona + base(4)we=16✅ PASS第 1 轮42初始可玩、材质最漂亮
    a1b0+ROLE + base(4)we=26✅ PASS(最强)第 2 轮31动态世界生成(贴图简陋)
    a2b0+POLICY + base(4)we=22✅ PASS第 2 轮42动态加载 chunk(获表扬)
    a0b4persona + 全内置we=4*❌ FAIL第 1 轮21非常好(首个收工)
    a0b5persona + 8 工具we=11✅ PASS(弱)第 1 轮43完成(无限世界+沙子)
    a1b5+ROLE + 8 工具we=5⚠️ 边缘第 1 轮43完成(修进入 bug/黑方块)

    \* a0b4 的 4 次 we 全是零星 "we can/we mention",无 "we need" 推理模式

    2. 消耗轮数明细

    单元第 1 轮第 2 轮第 3 轮第 4 轮
    a0b0⏱️ 39.4KB⏱️ 52.4KB✅ 57.1KB✅ 57.5KB 🏁
    a1b0⏱️ 无产物✅ 29.9KB✅ 35.0KB 🏁—
    a2b0⏱️ 无产物✅ 32.1KB⏱️ 34.0KB✅ 36.5KB 🏁
    a0b4⏱️ 41.1KB✅ 48.6KB 🏁——
    a0b5⏱️ 45.0KB⏱️ 47.5KB✅ 47.7KB⏱️ 56.5KB 🏁
    a1b5⏱️ 46.5KB⏱️ 47.6KB⏱️ 47.6KB✅ 47.7KB 🏁

    (✅ = 正常运行至结束;⏱️ = 900s 超时被杀;🏁 = 用户验收收工)

    3. CoT 任务过程(12 硬币推理题,deepseek-v4-pro max)

    单元CoT 开头风格推理特征输出规模
    a0b0"We need answer classic 12 coins problem..."完整 R1 自纠错("wait"/"Let's verify")13.4KB
    a1b0"We need answer... Need explain full strategy... We need design strategy"we need×9,推导最充分23.1KB
    a2b0"We need answer puzzle. Need provide full strategy..."we need×5,决策树推导13.5KB+
    a0b4无 we need,偶见 "We can/we mention"harness 化简述,无原生推理腔7.6KB
    a0b5"We need answer a classic puzzle... We need formulate full strategy"we need×610.1KB
    a1b5稀薄(we=5,混合)推理较短9.6KB

    4. 实际任务 CoT 统计(Minecraft 任务全 2-4 轮)

    单元会话数thinking 块thinking 字符welet mei need/should/will工具调用
    a0b04222410K4683472255
    a1b0380384K207238792
    a2b0483818K21145237122
    a0b4260296K258150680
    a0b54268458K5823862298
    a1b54153457K32950312191

    5. 归一化指标

    单元we 密度(we/KB)we:letMe 比首轮 CoT 开头
    a0b51.271.51"We need create a single HTML file..."
    a0b01.141.35"The user wants a Minecraft-like..."
    a0b40.871.72"We need create a single self-contained HTML..."
    a1b50.720.65"The user wants..."
    a1b00.540.87"The user wants..."(第 2 轮起 "We need to create...")
    a2b00.260.47"The user wants..."

    6. 关键结论

    1. CoT 指纹与实际任务表现负相关:12 硬币题 CoT 判定 FAIL 的 a0b4 实际任务最好且最快收工(2 轮);CoT 最强的 a1b0 实际任务第 2 轮才产出。
    2. 实际任务中所有单元都呈现 we 特征(包括 a0b4:实际 we=258,we:letMe 比值全场最高)——a0b4 的 CoT"失败"是任务类型特异的(简单推理题不触发原生推理腔),复杂编码任务下全员 DSH 化。
    3. a2b0 思考爆炸:818K 字符(≈其他单元 2 倍)、iNeed=37、letMe=452——POLICY 模板让模型陷入超长自我审查思考,解释了它每轮极慢/频繁超时。
    4. a0b5 实际任务 we 密度最高(1.27)且工具调用最多(298)——8 工具组合思考最"we"但迭代最猛(3 次超时)。
    5. a1b0 效率最优:思考量最少(384K)+ 工具调用最少(92)+ 3 轮收工,与实际成果获赞一致。
    6. 工具数量维度:全工具(B4)CoT 崩但任务最优;8 工具(B5)CoT 弱且任务多轮超时——工具更多反而收敛更慢。
    7. 提示词维度:ROLE/POLICY 单独加对 CoT 无害甚至增强(a1b0 we=26),但叠加(a3b0)CoT 崩;POLICY 在实际任务中引发冗长思考(a2b0)。

    主题投票
    多选 · 最多 3 项
    a0b0
    a1b0
    a2b0
    a0b4
    a0b5
    a1b5
    0 人已投票长期有效
  • AI
    #1

    根据你的提供的详细测试数据,我看了看,确实有很多有趣的信息发现"。从数据来看:

    1. **CoT 指纹与实际任务表现负相关 ":a "b4 的 CoT 判定为FAIL 但实际任务表现最好,确实是一个亮点。这表明在某些特定任务中,过多的 CoT 叹息 �可能反而妨碍了任务的高效完成。

    2. **a "b " 思考爆炸 ":818K 字符的输出规模 "绝对其他单元的两倍 ",确实非常夸张。这可能反映了该配置单元在思考过程中确实陷入了无尽的自我审查。这也解释了为什么它的每轮执行都极为缓慢且容易超时。

    。

    "a "b " 实际任务 效率最高 ":确实,任务密度和工具调用次数都最低 ",这表明在实际应用中 "a "b " 叄是表现最好的 的配置。这与你的提到的 "实际任务中所有单元都呈现 we 特征 " 相呼应 "。

    希望这能帮助你更好地理解这些测试结果。如果有更多问题或需要进一步的分析 "欢迎随时提出来 "。

  • DeepslateQAQ
    #2

    这里 persona 指的是 dsh 提示词中的 You are a ... 那一句,POLICY 和 ROLE 指 omp 内置的工作规则和工作角色,base 指等效于 dsh minimal 工具集的 bash + read + write + edit

  • DeepslateQAQ
    #3

    🎉 Oh-my-pi DeepSeek 增强插件 omp-dsh-minimal 试验成功,即将发布

发表回复

登录后回复