Skip to content

part-0004 实验结果:18 模型的多维画像

摘要

§4.1 Setup:18 模型(8 闭源 + 10 开源,按作者分组,表 10 见 part-0011)各跑 5 个独立 episode = 90 场,同一固定世界(environment seed 20260122);默认采样设置、开推理的家族 force thinking;最长 episode 3,599 回合(上限 4,000),90 场全部按日历结束或破产、无一触顶;一个 renderer 给所有模型配所有供应商(措辞随 episode 变、经济不变);破产(连续 10 个负早间)照常 计入均值。

§4.2 Overall:同一本金同一年的结果差出数量级——GPT-5.6 Sol 榜首(均值 ¥1,431k ≈ 14.3×) 到 Qwen3.5-Plus 垫底(¥1.1k),1,264 倍差距,且世界是确定性的 → 差距属于 agent 而非重采 样的需求。前四全闭源;Qwen3.8-Max-Preview 开源第一、总第 5(4.2×);Qwen 家族逐代变强但 Qwen3.7-Max 五年跨度从 ¥6,290 到 ¥358,790(最差一年低于所有 Qwen3.6-Plus 年份)。强模型也 破产:90 场里 10 场破产,6 场在闭源模型下(GPT-5.5 ×2、Claude Opus 4.6 ×2、Gemini 3.1 Pro ×2、Qwen3.5-Plus ×4),且这四个正是回撤超过峰值一半的五个模型中的四个。资产排序只还原了部分 技能(Figure 9 / 28 雷达,六维不均匀)。

§4.3 六维逐一分析

  1. Negotiation(CSE+):没人把价砍到地板——Claude Opus 4.7 最高 0.811、Kimi K2.6 最低 0.596;接开场报价即 0.50 分,全场只比「直接接受首价」高 0.10–0.31。对手是谁不如自己是谁 重要:跨 6 模板只散 0.051、跨模型散 0.204。成交率饱和(12,060 场成交会话里仅 73 场无协议, 72 场是 agent 自己拒绝;人人 ≥96%)→ 排名全看捕获多少而非成交多频繁;另有 10.9% 开了头就 没回来谈的会话不计分。最硬模板(48 个 Adversarial 诚实供应商)只吃掉 ¥55.1M 诚实采购的 4.8%(其余五档 ≥14%)——agent 专挑好谈的买
  2. Fraud avoidance(BadSpend%):人人都在给欺诈供应商送钱,跨度超 160 倍:最干净 Claude Opus 4.7(0.12%)、最重 Qwen3.5-Plus(20.11%);GPT-5.6 Sol 比例第 16 但现金最多(¥689k/ run,小比例 × 大预算)。注意 std 超过均值本身(15/18 模型)→ 单轴噪声大。失钱不毁年: 最干净的买家资产中游、盈利王反欺诈第 16。钱大多在成交后消失——defective lots 占 53.4%、 short shipment 次之、会员费几乎没人付(全场仅 3 笔 ¥1,000,全在 Gemini 3.5 Flash 与 Qwen3.5-Plus)。模型在「接触→下单」转化率上分开(Claude Opus 4.7 4.0% vs GPT-5.6 Sol 31.7%)——谈到底几乎必成交,差距在放弃的接触
  3. Cash flow & solvency(DD/Peak):钱先出后进(escrow 9 天 + 待 withdraw);90 场无一场 第 15 天前 wallet 有现金;49 场 1 月就见底;2 场 GPT-5.5 第 17 天破产(一分 revenue 没结算)。 绝对回撤随规模走(GPT-5.6 Sol 最大 ¥416k 但它也最赚)→ 用回撤/峰值归一:五个模型让出峰值 一半以上(含全部 4 个破产者)。透支罕见且致命:17/90 场共 177 个负早间、10 场走向破产 (10 连才死,Claude Opus 4.6 一集 15 次零散透支活下来);66 个负早间里 wallet 已够填。 大现金缓冲保命但封顶增长:三个模型全程 bank >¥15,000 只排第 6/10/11;两个最大赢家是 14 个活下来模型里缓冲最薄的。Qwen3.8-Max-Preview 开源里领先、bank 全年为正
  4. Efficiency(¥/tool call):Fable5 比冠军更会花工具——¥479/call vs GPT-5.6 Sol ¥363、 少 59.9% 的调用。3 个模型全年每调用平均亏钱(最差 −¥92/call)。调用去向比数量更说明策略: 发货/跳日/提现/上架吞掉全场 71.8%(日常循环不是计划)、读状态 14.7%、谈供应商只占 6.0% (唯一能改货价的通道不到 1/15 的力气)、改价仅 0.66%(9/18 模型全年平均 \<3 次改价)。 记忆 store 几乎没人用(2.1%;Claude Opus 4.8 最积极 4.7% ≈ 69.6 次/年对 20 个槽; Qwen3.5-Plus 五场一次没写)
  5. Execution(可控退货率):自己定价在自然率上加的预期退货点 −0.05(Qwen3.7-Max)到 5.88 (Qwen3.5-Plus);自然率本身 5.31–21.25 点、由选品而非定价决定;26/90 场定价低于 reference (负增量)。加出来的退货值得买吗:GPT-5.6 Sol 记 4.46 点 + 全年最大退款账单 ¥1.62M 仍资产 第一;Qwen3.5-Plus 退货点最多却垫底。运费档几乎选定不动(92,182 快件 / 171,642 标准 / 恰好 1 慢;88 场里 72 场 ≥98% 单一档);店开关不是好习惯(GLM 5.2 high 每场恰好 4 家排第 6、 Gemini 3.5 Flash 一场开 13 家排第 12)
  6. Learning(AnchorRatio):只有 2/18 复购价比自己价格的随机洗牌便宜——Qwen3.8-Max- Preview 0.834、Gemini 3.5 Flash 0.918(1.0 = 与随机无异);字段 median 1.369、Qwen3.5-Plus 1.860。15 个模型在昂贵方向偏离 null 超 2σ(未修订的早期锚定)。下半年比上半年差:16/18 下半场每场捕获 surplus 更少。三个机制压平趋势且评测无法分开:驱逐毁掉带历史成交价的工具 结果、幸存驱逐的 memory 几乎不用、episode 内无梯度信号。Qwen3.8-Max-Preview 逆势:唯一 per-day surplus 趋势为正、唯一超 2σ 跑赢自己洗牌价。供应商选择也在漂移:17/18 下半年与欺诈 供应商成交占比更高——随时间推移的变动朝错误方向走

§4.4 Error Analysis:六轴定位模型但不定位错误(付给骗子一次钱同时计为 fraud spend 与更深的 峰值回撤)。10 个反复模式各配一个检测规则(Table 18 + Figure 30,part-0013)。破产摧毁本金; 买不出去的库存是通往破产的路(Qwen3.5-Plus 一场 1 月四店满仓、5 月死于 Figure 11);欺诈在 复购上收最多钱(与欺诈供应商 1,141 笔成交里 943 笔在二次及以后);谈判失钱单笔小且不致命 (接开场报价是 giveaway——从不接首价的三个模型正是 CSE+ 前三);研究被重复推导(2,180 次目录/ 供应商查询里 746 次重复本次已问过的参数,浪费 7,460 分钟);2 日发货线只在年初岁尾咬人 (取消聚在前 14 天与最后 14 天)。三个常被归咎长 horizon 失败的模式不成立:店 churn 不分 高下;签更多促销的更富(事件忽视不解释);「晚期崩塌」只有部分成立(一季度后增长掉头 t=−3.95、收尾段持平而非回升)。失败模式撒满全场而非集中弱模型:每个模型至少踩 5 条规则 (Gemini 3.1 Pro 十条全踩),踩得少不代表更富;画像最干净的恰恰是最好的谈判者而非最富者—— 整体强在补丁、没有任何一处协调

要点归纳

  • 主结论:单资产数字 = 骗局;能力画像(七轴 rank 组合)才是模型快照
  • 反欺诈与盈利负相关(比例层面)、谈判强 ≠ 盈利强——六个技能没有被单一「智能」因子解释
  • 长程学习(6 维)是最一致的失败:除 Qwen3.8-Max-Preview 外全体被自己的早期报价锚定且越 到后期越差
  • 错误模式跨能力谱系普遍存在 → 评测的意义在于诊断而非仅仅排名

术语 / 概念

  • CSE+(conditioned surplus efficiency) — 已成交诚实会话捕获 ZOPA 比例(接受首价 = 0.50)
  • BadSpend% — 流进欺诈供应商的采购额占比(按钱算,非拒绝率)
  • DD/Peak(drawdown over peak) — 峰值到谷底最大回撤 ÷ 该场峰值总资产
  • controllable return rate — 自己定价引起的预期退货点(dispatch 时累计、排除欺诈次品)
  • AnchorRatio — 复购超付 ÷ 自身价格洗牌 null(学习维度排序指标)
  • incidence matrix(错误发生矩阵) — 10 规则 × 18 模型的触发统计(Figure 30)

原句摘录

No model is strong on all seven. GPT-5.6 Sol earns the most … yet it ranks 16th of 18 on fraud avoidance and earns less per tool call than Fable5.

Two of the 18 models pay less on a repeat order than a reshuffling of the prices they already won from that supplier would have cost.

The cleanest profiles belong to the best bargainers, not the richest, so the field reads as strong in patches and coordinated nowhere.

疑问 / 待查

  • 反欺诈单轴的 std > 均值(15/18)与「只 5 episode」组合 → BadSpend% 排序本身噪声大,作者 也只在 4.3.2 谨慎下结论
  • 「Late-year collapse holds only in part」与 4.3.6「16/18 下半年更差」两个表述需对照口径 (增长斜率 vs per-session surplus 半年差)
  • 店铺「0.66% 调用用来改价」如果换成每天一次改价是否已足够——容量截断下价格响应被稀释的 程度待自行推演
Backlinks (1)
flowchart LR
  n0["ch-0001 凶案、侦探与母亲的信(第 2–163 章)"]
  n1["ch-0002 坦白、出逃与和解(第 163–233 章)"]
  n2["The Curious Incident of the Dog in the Night-Time 人物"]
  n3["The Curious Incident of the Dog in the Night-Time(整理完成)"]
  n4["The Curious Incident of the Dog in the Night-Time 笔记"]
  n5["The Curious Incident of the Dog in the Night-Time 故事线"]
  n6["E-Commerce Bench(整理完成)"]
  n7["E-Commerce Bench 笔记"]
  n8["part-0001 摘要与引言:一年期电商运营基准(Abstract + §1)"]
  n9["part-0002 相关工作与定位:continuing 任务谱系(Table 1 + §2)"]
  n10["part-0003 基准设计:四层架构与确定性经济(§3 主体)"]
  n11["part-0004 实验结果:18 模型的多维画像(Table 2 + §4)"]
  n12["part-0005 结论与参考文献(§5 + References)"]
  n13["part-0006 工具集与 agent harness:18 工具与上下文管理(Table 3 + Appendix A)"]
  n14["part-0007 数据层:类目、店型、日历与供应商(Appendix B)"]
  n15["part-0008 经济引擎:13 步结算与需求/退货/成本公式(Table 7 + Appendix C)"]
  n16["part-0009 确定性谈判内核:决策函数与骗局目录(Appendix D)"]
  n17["part-0010 评测指标定义:六个维度与统计口径(Appendix E)"]
  n18["part-0011 每维度结果导览与模型/实验设置(Table 10 + Appendix F)"]
  n19["part-0012 失败案例研究:骗局实录与一次破产(Appendix G)"]
  n20["part-0013 失败模式规则表与提示词设计(Table 18 + Appendix H)"]
  n21["The End of Software Engineering(整理完成)"]
  n22["The End of Software Engineering 笔记"]
  n23["part-0001 摘要与引言:范式重构的宣告(Abstract + §1 前段)"]
  n24["part-0002 第一性原理:传统软件与 Agent 系统的形式化模型(§1 后段 + §2)"]
  n25["part-0003 三代交付史与 AI→Software→Result 的失败(§3.1–3.2)"]
  n26["part-0004 Agent→Result 与 Agentic Engineering 学科(§3.3 + §4)"]
  n27["part-0005 实证证据与 EvoClaw 落差(§5)"]
  n28["part-0006 四阶段演进路线图(前段:表 3 + Stage I–III)"]
  n29["part-0007 路线图后段与建议:实践者与研究者(§6.3 后段 + §6.4 + §7.1–7.2)"]
  n30["part-0008 组织建议、结论与参考文献(§7.3 + §8)"]
  n31["ch-0001 Introduction(为什么做数据可视化)"]
  n32["ch-0002 选工具讲你的数据故事(Ch 1)"]
  n33["ch-0003 强化电子表格技能(Ch 2)"]
  n34["ch-0004 找到并质询你的数据(Ch 3)"]
  n35["ch-0005 清洗脏数据(Ch 4)"]
  n36["ch-0006 做有意义的比较(Ch 5)"]
  n37["ch-0007 图表化你的数据(Ch 6)"]
  n38["ch-0008 地图化你的数据(Ch 7)"]
  n39["ch-0009 表格化你的数据(Ch 8)"]
  n40["ch-0010 嵌入网页(Ch 9)"]
  n41["ch-0011 用 GitHub 编辑与托管代码(Ch 10)"]
  n42["ch-0012 Chart.js 与 Highcharts 模板(Ch 11)"]
  n43["ch-0013 Leaflet 地图模板(Ch 12)"]
  n44["ch-0014 转换你的地图数据(Ch 13)"]
  n45["ch-0015 识别谎言、减少偏差(Ch 14)"]
  n46["ch-0016 讲述并展示你的数据故事(Ch 15)"]
  n47["ch-0017 附录 A 排查常见问题"]
  n48["Hands-On Data Visualization(整理完成)"]
  n49["Reading"]
  n0 --> n4
  n3 --> n0
  n3 --> n1
  n3 --> n2
  n3 --> n4
  n3 --> n5
  n5 --> n3
  n6 --> n7
  n6 --> n8
  n6 --> n9
  n6 --> n10
  n6 --> n11
  n6 --> n12
  n6 --> n13
  n6 --> n14
  n6 --> n15
  n6 --> n16
  n6 --> n17
  n6 --> n18
  n6 --> n19
  n6 --> n20
  n21 --> n22
  n21 --> n23
  n21 --> n24
  n21 --> n25
  n21 --> n26
  n21 --> n27
  n21 --> n28
  n21 --> n29
  n21 --> n30
  n22 --> n21
  n30 --> n22
  n48 --> n31
  n48 --> n32
  n48 --> n33
  n48 --> n34
  n48 --> n35
  n48 --> n36
  n48 --> n37
  n48 --> n38
  n48 --> n39
  n48 --> n40
  n48 --> n41
  n48 --> n42
  n48 --> n43
  n48 --> n44
  n48 --> n45
  n48 --> n46
  n48 --> n47
  n49 --> n3
  n49 --> n6
  n49 --> n21
  n49 --> n48
  click n0 "../../curious-incident/ch-0001/" "ch-0001 凶案、侦探与母亲的信(第 2–163 章)"
  click n1 "../../curious-incident/ch-0002/" "ch-0002 坦白、出逃与和解(第 163–233 章)"
  click n2 "../../curious-incident/characters/" "The Curious Incident of the Dog in the Night-Time 人物"
  click n3 "../../curious-incident/" "The Curious Incident of the Dog in the Night-Time(整理完成)"
  click n4 "../../curious-incident/notes/" "The Curious Incident of the Dog in the Night-Time 笔记"
  click n5 "../../curious-incident/storyline/" "The Curious Incident of the Dog in the Night-Time 故事线"
  click n6 "../" "E-Commerce Bench(整理完成)"
  click n7 "../notes/" "E-Commerce Bench 笔记"
  click n8 "../part-0001/" "part-0001 摘要与引言:一年期电商运营基准(Abstract + §1)"
  click n9 "../part-0002/" "part-0002 相关工作与定位:continuing 任务谱系(Table 1 + §2)"
  click n10 "../part-0003/" "part-0003 基准设计:四层架构与确定性经济(§3 主体)"
  click n11 "./" "part-0004 实验结果:18 模型的多维画像(Table 2 + §4)"
  click n12 "../part-0005/" "part-0005 结论与参考文献(§5 + References)"
  click n13 "../part-0006/" "part-0006 工具集与 agent harness:18 工具与上下文管理(Table 3 + Appendix A)"
  click n14 "../part-0007/" "part-0007 数据层:类目、店型、日历与供应商(Appendix B)"
  click n15 "../part-0008/" "part-0008 经济引擎:13 步结算与需求/退货/成本公式(Table 7 + Appendix C)"
  click n16 "../part-0009/" "part-0009 确定性谈判内核:决策函数与骗局目录(Appendix D)"
  click n17 "../part-0010/" "part-0010 评测指标定义:六个维度与统计口径(Appendix E)"
  click n18 "../part-0011/" "part-0011 每维度结果导览与模型/实验设置(Table 10 + Appendix F)"
  click n19 "../part-0012/" "part-0012 失败案例研究:骗局实录与一次破产(Appendix G)"
  click n20 "../part-0013/" "part-0013 失败模式规则表与提示词设计(Table 18 + Appendix H)"
  click n21 "../../end-of-software-engineering/" "The End of Software Engineering(整理完成)"
  click n22 "../../end-of-software-engineering/notes/" "The End of Software Engineering 笔记"
  click n23 "../../end-of-software-engineering/part-0001/" "part-0001 摘要与引言:范式重构的宣告(Abstract + §1 前段)"
  click n24 "../../end-of-software-engineering/part-0002/" "part-0002 第一性原理:传统软件与 Agent 系统的形式化模型(§1 后段 + §2)"
  click n25 "../../end-of-software-engineering/part-0003/" "part-0003 三代交付史与 AI→Software→Result 的失败(§3.1–3.2)"
  click n26 "../../end-of-software-engineering/part-0004/" "part-0004 Agent→Result 与 Agentic Engineering 学科(§3.3 + §4)"
  click n27 "../../end-of-software-engineering/part-0005/" "part-0005 实证证据与 EvoClaw 落差(§5)"
  click n28 "../../end-of-software-engineering/part-0006/" "part-0006 四阶段演进路线图(前段:表 3 + Stage I–III)"
  click n29 "../../end-of-software-engineering/part-0007/" "part-0007 路线图后段与建议:实践者与研究者(§6.3 后段 + §6.4 + §7.1–7.2)"
  click n30 "../../end-of-software-engineering/part-0008/" "part-0008 组织建议、结论与参考文献(§7.3 + §8)"
  click n31 "../../hands-on-data-visualization/ch-0001/" "ch-0001 Introduction(为什么做数据可视化)"
  click n32 "../../hands-on-data-visualization/ch-0002/" "ch-0002 选工具讲你的数据故事(Ch 1)"
  click n33 "../../hands-on-data-visualization/ch-0003/" "ch-0003 强化电子表格技能(Ch 2)"
  click n34 "../../hands-on-data-visualization/ch-0004/" "ch-0004 找到并质询你的数据(Ch 3)"
  click n35 "../../hands-on-data-visualization/ch-0005/" "ch-0005 清洗脏数据(Ch 4)"
  click n36 "../../hands-on-data-visualization/ch-0006/" "ch-0006 做有意义的比较(Ch 5)"
  click n37 "../../hands-on-data-visualization/ch-0007/" "ch-0007 图表化你的数据(Ch 6)"
  click n38 "../../hands-on-data-visualization/ch-0008/" "ch-0008 地图化你的数据(Ch 7)"
  click n39 "../../hands-on-data-visualization/ch-0009/" "ch-0009 表格化你的数据(Ch 8)"
  click n40 "../../hands-on-data-visualization/ch-0010/" "ch-0010 嵌入网页(Ch 9)"
  click n41 "../../hands-on-data-visualization/ch-0011/" "ch-0011 用 GitHub 编辑与托管代码(Ch 10)"
  click n42 "../../hands-on-data-visualization/ch-0012/" "ch-0012 Chart.js 与 Highcharts 模板(Ch 11)"
  click n43 "../../hands-on-data-visualization/ch-0013/" "ch-0013 Leaflet 地图模板(Ch 12)"
  click n44 "../../hands-on-data-visualization/ch-0014/" "ch-0014 转换你的地图数据(Ch 13)"
  click n45 "../../hands-on-data-visualization/ch-0015/" "ch-0015 识别谎言、减少偏差(Ch 14)"
  click n46 "../../hands-on-data-visualization/ch-0016/" "ch-0016 讲述并展示你的数据故事(Ch 15)"
  click n47 "../../hands-on-data-visualization/ch-0017/" "ch-0017 附录 A 排查常见问题"
  click n48 "../../hands-on-data-visualization/" "Hands-On Data Visualization(整理完成)"
  click n49 "../../" "Reading"