有用智能
比较模型在真实任务中的能力、可靠性、成本与研发供给,不依赖单一榜单。
Semi-monthly Monitor
每月 1 日与 16 日更新。只记录相较上期发生的、可核实且足以改变判断的信号;宣传口径、传闻和重复旧闻不进入评分。
Measurement
三个一级结果、十个二级驱动和 38 个 Level 3 观测项,中美使用相同口径。
比较模型在真实任务中的能力、可靠性、成本与研发供给,不依赖单一榜单。
比较芯片、HBM、封装、集群、软件栈、云和电力组成的有效算力,不只数卡。
比较开发者生态、产业生产率、商业回报以及国际采购和标准采纳。
评分不是胜率。 精确值用于画线,公开判断同时给出优势区间与证据覆盖率。
缺失不是平手。 无对称证据时记录 NA;企业单方宣称只进观察清单。
Score history
-100 为中国方向,+100 为美国方向。仅使用 methodologyVersion 1.1 的已发布半月快照。
精确值只用于复算和画线,不暗示个位数有现实精度。 当前只有 3 个观察点,这是时间序列起点,暂不据此解读趋势方向。
Issues
首期是基线;后续每期都会与上一份快照逐项对比。
截至 2026 年 8 月 16 日 09:00:Qwen3.8 与 DeepSeek V4 Pro 补强中国侧前沿模型观察,但严格 cutoff 与可比门槛均不支持改分。
截至 2026 年 8 月 1 日 09:00:Kimi K3 开放完整权重、CAISI 发布网络能力评估,但固定指标尚无一项跨过改分门槛。
2026 年 7 月 21 日基线:用对称指标跟踪有用智能、可部署算力和生态价值捕获,区分真正的结构变化与新闻噪声。