中美 AI 半月监测 #02:Qwen 与 DeepSeek 上榜,结构分未变
截至 2026 年 8 月 16 日 09:00:Qwen3.8 与 DeepSeek V4 Pro 补强中国侧前沿模型观察,但严格 cutoff 与可比门槛均不支持改分。
更新于

Executive Summary
资料窗口:2026 年 8 月 1 日 09:00 之后至 2026 年 8 月 16 日 09:00(北京时间)。
- 本期无结构性变化。 v1.1 综合分仍为 +17,未四舍五入值为 +17.2,处于“美国小幅优势”区间;相较上期事实变化 0 分。
- 证据覆盖率仍为 48.75%,属于“暂定”。 coverageDelta 为 0 个百分点,methodEffect 为 0 分。本期没有把
NA重新分配成已有指标,也没有把证据不足写成平手。 - 中国侧前沿模型供给明显补强,但不足以改分。 千问平台在窗口内上线 Qwen3.8-Max、Qwen3.8 开放版本与 DeepSeek V4 Pro 0813;8 月 17 日的独立榜单回看显示 Artificial Analysis 与 LiveBench 的中美前三家族中位数差距都缩小。
- 严格 cutoff 是本期的关键约束。 独立榜单的新模型行缺少可以证明其在 8 月 16 日 09:00 前已经发布的行级时间戳;只有 LiveBench 的观察差距变化超过 5 点,Artificial Analysis 变化为 4 点,而且两者量纲不能直接相加。相关结果进入观察清单,不触发 U1.1 或 U3.1 改分。
- 固定篮子没有被选择性裁剪。 Arena 正式页仍停留在 8 月 1 日快照;NIST/CAISI 没有新增同口径受控评估;SWE-bench-Live 仍不足以构成中美各三家族的对称篮子。
+17.2只用于复算和时间序列,不表示现实判断精确到个位数。综合分不是胜率、预测或投资建议。
分数与覆盖率
| 结果 | 上期 | 本期 | 事实 delta | coverage | 解读 |
|---|---|---|---|---|---|
| 有用智能 | +7 | +7 | 0 | 54% | 新模型缩小部分榜单差距,但 cutoff 与多评测族门槛未满足 |
| 可部署算力 | +33 | +33 | 0 | 55% | 已验证差距仍集中在芯片、互联、软件栈和可租用云容量 |
| 生态与价值捕获 | +9 | +9 | 0 | 38% | 中国开放模型观察增强,但许可、扩散与商业回报仍缺对称分母 |
| 综合 | +17 | +17 | 0 | 48.75% | 美国小幅优势;判断暂定 |
精确计算为:100 ÷ 3 × Σ(38 项固定权重 × Level 3 分数)= +17.2。38 项固定权重合计 1.0,三个 Level 1 权重仍为 30% / 35% / 35%;具有有效 -3..+3 分数的固定权重合计 48.75%。
事实变化与方法/覆盖变化
| 变化层 | 本期结果 | 原因 |
|---|---|---|
| 事实变化 | 0 分 | 没有 cutoff 合格的 A/B 级新增证据使任一 Level 3 同时跨过评分区间和实质门槛 |
| coverageDelta | 0 个百分点 | 新证据补强观察,没有把 NA 变成有效分数,也没有有效值超过陈旧期限 |
| methodEffect | 0 分 | methodologyVersion 仍为 1.1;定义、38 项权重、篮子、NA 规则和门槛均未改变 |
本期出现了“事实事件在窗口内、独立测量在截止后回看”的情况。文章公开保留这项观察,但评分只使用能证明在 cutoff 前已经公开的证据,避免把晚到数据倒灌进时间序列。
达到门槛的变化
无。 三个 Level 1 与 38 个 Level 3 均未改分,因此也不满足“至少两个 Level 1 连续两期同向变化”才可称为结构性转折的规则。
未改分观察
1. Qwen3.8 与 DeepSeek V4 Pro:前沿供给增强,发布事实与性能宣称分开处理
- 8 月 3 日上线 Qwen3.8-Max,平台披露其为 2.4T MoE、支持 100 万 token 上下文;
- 8 月 13 日上线 Qwen3.8-2.4T-A95B,平台将其描述为开放版本,披露每步激活约 95B;
- 同日上线 DeepSeek V4 Pro 0813,平台披露总参数 1.6T、激活 49B、支持 100 万 token 上下文。
Qwen 自有平台上的上线时间、参数与可调用性属于可核验发布事实;“能力显著提升”等性能描述仍是企业单方宣称。DeepSeek 条目只能确认该平台提供了指定版本,不能替代 DeepSeek 自身发布记录或独立性能测量。
对 E1.2 而言,Qwen 页面称其为开放版本,但本期 cutoff 内没有完成对完整权重、许可证、可商业使用范围和生产扩散的独立核验。因此 E1.2 仍为 -1(中国小幅领先),不把“开放”两个字直接当成完整开放工件。
2. 独立榜单回看:差距缩小是真实观察,但不是本期可评分变化
8 月 17 日访问 Artificial Analysis 时,其 v4.1.1 指数的中美前三基础模型家族中位数分别为 58 和 62,美国方向差距为 4 点;上期同口径记录为 51 与 59,差距为 8 点。
同日读取 LiveBench 的 2026-06-25 公开数据时,中国前三家族中位数为 78.4609,美国为 81.0535,差距为 2.5926 点;上期差距为 7.8962 点,观察变化为缩小 5.3036 点。
这两项都显示中国侧新家族进入前沿区间,但不触发 U1.1 改分:
- 榜单没有提供新模型行的发布时间,无法证明这些行在 cutoff 前已经可见;
- 只有 LiveBench 的观察变化超过 5 点,Artificial Analysis 为 4 点;
- 一个是复合指数点,一个是类别均值百分点,不能为了过门槛而直接平均;
- Arena 没有新的正式窗口快照,不能只保留支持“差距缩小”的榜单。
3. U3.1:两个候选家族出现,不等于滚动篮子已经完成重估
Qwen3.8 与 DeepSeek V4 Pro 0813 在晚到榜单读取中都进入中国侧前三,构成两个值得跟踪的前沿家族候选。但 U3.1 要求滚动 12 个月、至少两个评测族、全球前 10% 与基础家族去重后的对称计数。本期无法证明新行的 cutoff 合格时间,也没有完成中美全篮子同口径重算,所以 U3.1 继续为 +1(美国小幅领先)。
这不是否认新模型,而是把“发布”“独立上榜”“达到滚动篮子门槛”拆成三个不同阶段。
4. 其余固定篮子:没有用旧榜单制造假更新
Arena Text Leaderboard的正式页仍标注 8 月 1 日,本期沿用上期中美中位数差距 30.7524 Arena 分,不把低票数或非正式变化写入 cutoff 快照。
NIST/CAISI没有发布新的中美各三家族受控评估;SWE-bench-Live也没有形成共享隐藏题分母上的中美对称前三家族。二者继续作为边界证据。SWE-bench Verified 只作历史参照,不回到主评分。
Level 1 解释
有用智能:+7,coverage 54%
Qwen3.8 与 DeepSeek V4 Pro 增加了中国侧前沿家族深度,晚到榜单也显示差距收窄;但只有 cutoff 合格、同口径、跨过门槛的结果才能改变时间序列。长程可靠性、可信部署与服务可获得性仍缺对称证据,因此有用智能维持 +7。
可部署算力:+33,coverage 55%
本期没有新的独立交付、HBM 合格产出、大集群 goodput、已通电容量或同时满足融资、施工、并网和电力四项条件的项目证据。模型参数增长不能替代国内实际可获得算力,C3.2 也继续为 NA。
生态与价值捕获:+9,coverage 38%
该 Level 1 的 coverage 低于 40%,因此不单独发布趋势判断。Qwen 开放版本是重要观察,但完整许可证、生产下游、付费推理、续约、客户 ROI 与第三国实际采购仍缺对称数据。普通工业机器人安装继续只占 E2.4b 的 0.75% 固定权重。
榜单分歧
| 榜单 | 中国前三基础家族中位数 | 美国前三基础家族中位数 | 本期处理 |
|---|---|---|---|
| Artificial Analysis v4.1.1 | 58 | 62 | 8 月 17 日回看差距 4 点;行级发布时间不可核验,只作观察 |
| LiveBench 2026-06-25 | 78.4609 | 81.0535 | 回看差距 2.5926 点;较上期缩小 5.3036,但 cutoff 不合格 |
| Arena Text(8 月 1 日正式页) | 1474.6573 | 1505.4097 | 没有新正式窗口快照,沿用上期记录 |
| NIST/CAISI | 不足 3 家族 | 不足 3 家族 | 没有新增同口径受控评估 |
| SWE-bench-Live | 不足 3 家族 | 不足 3 家族 | 共享隐藏题分母不对称,只作边界旁证 |
Artificial Analysis 偏复合智能指数,LiveBench 偏客观新鲜任务,Arena 是匿名人类偏好;它们的量纲、题集、推理预算与更新时间不同。共同方向可以形成观察,但不能把不同单位拼成一个刚好跨门槛的数字。
下一期观察
- Qwen3.8 开放工件。 核验权重完整性、许可证、商业使用范围、持续维护与独立部署,而不是只看平台文案。
- Qwen3.8 与 DeepSeek V4 Pro 的榜单时间线。 保存行级版本与发布时间,完成 U1.1、U3.1 的 cutoff 合格重算。
- Arena 与隐藏题软件工程评测。 等待新的正式快照和中美对称家族篮子,避免用低票数预览制造趋势。
- 算力从宣布到投产。 继续区分融资、施工、并网、电力、通电与商业回报;通电前 C3.2 封顶 ±1。
- 开放模型从上榜到价值捕获。 观察付费推理、活跃生产下游、续约与第三国实际采购,而不是下载量。
局限
- 固定权重 coverage 只有 48.75%,总体判断为“暂定”;生态与价值捕获只有 38%,不能单独发布趋势。
- 本期独立榜单读取发生在 cutoff 次日。新模型事件发生在窗口内,但新行发布时间不可核验,因此没有倒灌成分数。
- 企业平台可确认上线与参数,不自动证明性能、开放许可证、实际产能、生产采用或商业回报。
- 榜单的题集、量纲、推理档和发布时间不同;前三基础家族中位数能减少重复版本噪声,不能消除全部测量偏差。
- 最近有效值只在 v1.1 陈旧期限内沿用,并记录
sourceAsOf与staleDays;超期后改为NA,不重新分配权重。 - 至少两个 Level 1 连续两期同向变化,才可写成结构性转折。本期三个 Level 1 均未变化。
完整定义、38 项固定权重、NA 与门槛规则见方法论 v1.1,历期报告见中美 AI 观察。