DeepSWE v1.1 · 113 tasks · 榜面更新 2026-08-07 估算位 · 官方未复现

deepseek-v4-pro-0813

正式版(GA)。DeepSWE 分数取 DeepSeek 官方评测表 62.7;成本轴由榜上 deepseek-v4-flash[max] = $0.10/题 这个锚点按 Pro/Flash 的单价倍率反推,所以横坐标是一段区间、不是一个点。

DeepSWE Pass@1
62.7%官方自评 · 榜上待复现
推估成本 / 题
≈$0.24区间 $0.18 – $0.30
预计排名
#8共 22 个 model(best config)
帕累托前沿
进入插在 flash 与 gpt-5.6-luna 之间

成本 – 分数平面

成本反推

flash[max] 实测$0.100 / 题
└ 输出 108k × ¥2/M$0.030
└ 输入(余项)$0.070
Pro 输出单价×3.0(¥2→¥6)
Pro 输入 · 未命中×3.0(¥1→¥3)
Pro 输入 · 缓存命中×1.25(¥.02→¥.025)
同轨迹硬边界$0.178 – $0.300

缓存命中率 f 决定落点:f=1.00 → $0.18;f=0.97 → $0.25;f=0.90 → $0.28。Agent 循环里 f 通常 0.95–0.99,取中值 $0.24。Pro 更聪明、步数可能少于 flash 的 153 步,真实值大概率偏区间下沿。

可比性校准

模型DS 自评榜面Δ
claude-fable-570.0700.0
claude-opus-4.858.059−1.0
v4-flash-073154.453+1.4

三个交叉点全部落在榜面置信区间内 → DeepSeek 那张表用的就是同一套 DeepSWE 口径,62.7 可以直接摆上去。

新前沿

按成本升序 · 只列不被支配的点
模型 [config]Pass@1成本/题分/美元输出 tok步数