2026 年上半年是大模型格局剧烈洗牌的半年:仅 1 月到 6 月,全球就发布了超过 50 款前沿及开源模型,平均每月近 10 个,比 2023 全年总和还多。综合能力榜上,Anthropic 于 6 月 9 日发布的 Claude Fable 5 一度登顶;而在真实用量层面,国产模型集体爆发——据 OpenRouter 排行榜,DeepSeek V4 Flash 以单周 5.36T token 领跑,MiniMax、小米、腾讯、智谱等国产模型霸占用量榜前列。与此同时,也有玩家在"凉":Fable 5 因安全限制过严被开发者吐槽"不干活",部分明星产品热度回落。本文从"谁涨了、谁凉了、谁在闷声变强"三个维度,结合真实用量数据和公开事件,盘点 2026 上半年的大模型江湖。

 

先看数据:真实用量榜谁在领跑

判断一个模型"涨没涨",最硬的指标不是发布会 PPT,而是真实调用量。据 OpenRouter(聚合全球用量的模型平台)2026 年年中排行榜,单周 token 用量前十如下:

排名

模型

厂商

周用量

周趋势

1

DeepSeek V4 Flash

DeepSeek

5.36T

↑14%

2

MiMo-V2.5

小米

4.43T

↑1%

3

MiniMax M3

MiniMax

4.17T

↑13%

4

Hy3 preview

腾讯

2.81T

↑19%

5

GLM 5.2

智谱

2.8T

↑27%

6

DeepSeek V4 Pro

DeepSeek

2.53T

↑22%

7

Claude Opus 4.7

Anthropic

2.32T

↑4%

8

Claude Opus 4.8

Anthropic

2.1T

↑10%

9

Step 3.7 Flash

阶跃星辰

1.56T

↑2%

10

Claude Sonnet 4.6

Anthropic

1.36T

↑12%

一个最直观的结论:用量榜前六全是国产模型,DeepSeek 以两款模型进前六,智谱 GLM 5.2 周增速最高(↑27%)。Anthropic 的 Claude 系列虽在综合能力榜上强势,但在按量付费的真实调用里排到了中段。

谁涨了:国产模型集体爆发

2026 上半年最鲜明的趋势,是国产大模型在真实用量和能力榜上双双爆发,"中美差距"被显著缩小。这背后有几个代表性玩家:

 DeepSeek:V4 系列(Flash / Pro)稳居用量榜前列,Flash 单周 5.36T token 领跑,以强推理和高性价比持续走量,年中还推出了 V4 Preview 强调 Agent 能力

 智谱 GLM:GLM 5.2 周增速 27% 为前十最高,中文和工具调用表现稳定

 MiniMax / 小米 / 腾讯:MiniMax M3、小米 MiMo-V2.5、腾讯 Hy3 均进前四,多模态和消费级场景发力

 开源力量:有分析指出,美国的出口封锁反而"逼出了最强开源",国产开源模型与顶尖闭源的综合分差一度缩小到个位数

据中文媒体基于 Artificial Analysis 等综合指数的盘点,第一梯队已由 Claude、GPT、Gemini 与国产头部模型(如 GLM 系列)共同构成,“多极格局彻底成型、无绝对全能模型”。

谁在闷声变强:Anthropic 的密集迭代

Anthropic 虽然在真实用量榜上不占绝对第一,但上半年的迭代密度和综合能力口碑,让它成为"闷声变强"的代表。上半年它的动作包括:

 Claude Fable 5(6 月 9 日发布):一度在 Artificial Analysis 综合智能指数上登顶,是上半年综合能力的标杆之一

 Claude Opus 4.7 / 4.8:持续迭代旗舰线,Opus 4.8 定价每百万输入/输出 5 美元 / 25 美元,在高难度推理和仓库级工程上口碑硬

 Claude Sonnet 5(6 月 30 日发布):主打"最擅长 Agent 的 Sonnet",用中端价格逼近 Opus 性能,发布期输入/输出仅 2 美元 / 10 美元

 基础研究:还在可解释性等方向持续产出,维持技术权威形象

不过 Anthropic 也有隐忧:真实调用量被国产模型甩在身后,且有报道称阿里等企业出于合规考虑禁止员工使用 Claude Code。

谁凉了:热度与口碑的回落

有涨就有落,上半年也有几类"降温"信号,最典型的是 Fable 5 的口碑争议。

 Fable 5 的安全限制争议:据开发者反馈,Fable 5 在被制裁后"二进宫"复出,安全策略变得极严——正常写代码、debug 稍不留神就被判高风险、任务被降维处理,甚至"raspberry 里有几个 r"都被拦截,招致大量差评。能力再强,用起来处处受限,实际体验大打折扣。

 "跳票"消耗耐心:谷歌 Gemini 3.5 Pro 从 I/O 大会承诺"再给一个月"拖到七月仍未给确切日期,官方沉默期里全靠泄露维持热度,透支了部分期待。

 Agent 进展不及预期:连 Meta 的扎克伯格都公开承认,AI 智能体"没有像他希望的那样快速进步",行业对 Agent 的过高预期开始回调。

上半年三条主线趋势

回看 2026 上半年,大模型行业呈现三条清晰主线,理解它们比记住单个榜单更有价值。

1. 发布提速到"残忍":半年 50+ 款前沿/开源模型,平均每月近 10 个,迭代速度超过 2023 全年总和

2. 成本战全面打响:从 Sonnet 5(2/10 美元)到 GPT-5.6 Sol(5/30 美元),"同等能力更便宜"成为新卖点,性价比取代单纯堆能力

3. 多极格局定型:Claude、GPT、Gemini 与 DeepSeek、GLM、MiniMax 等国产模型并存,没有绝对全能王者,按任务选模型成为常态

对开发者意味着什么:按任务选模型

面对多极并存、各有所长的格局,2026 下半年更务实的用法是"按任务选模型",而非押注单一模型。不同任务的建议方向:

 高难度推理 / 仓库级工程 → Claude Opus 系列、GPT-5.6 等口碑更稳

 走量、性价比优先 → DeepSeek、GLM、Sonnet 5 等成本更低

 中文与本土场景 / 合规要求 → 国产模型访问稳定、贴合本地生态

 前端与视觉生成 → Gemini 系列被普遍看好

也正因为要在多款模型间灵活切换,"多模型统一接入"的平台价值凸显。要在同一套接口下按任务调用不同模型,可借助兼容主流 SDK、支持多模型统一接入的 API 平台——例如七牛云AI 汇聚了多款主流大模型,国内可直接访问,便于按任务在推理、走量、中文等不同强项的模型之间切换,减少逐个对接的成本。

常见问题

Q:2026 上半年哪个大模型用量最高?

据 OpenRouter 年中排行榜,DeepSeek V4 Flash 以单周约 5.36T token 领跑,且用量榜前六全部为国产模型(DeepSeek、小米、MiniMax、腾讯、智谱等)。Q:Claude Fable 5 为什么被吐槽?

主要是安全限制过严。据开发者反馈,它复出后正常写代码、debug 都容易被判为高风险、任务被降维,甚至简单问题也被拦截,能力虽强但实际体验受限。Q:国产大模型追上国际顶尖了吗?

在综合能力上差距显著缩小。据中文媒体基于综合指数的盘点,国产头部模型已进入第一梯队,与 Claude、GPT、Gemini 并列,部分开源模型综合分差缩小到个位数,但仍无绝对全能王者。

Q:上半年大模型行业最大的变化是什么?

一是发布提速(半年 50+ 款)、二是成本战(同能力更便宜成主流卖点)、三是多极格局定型(国内外模型并存、按任务选模型)。

Q:现在该怎么选大模型?

按任务选:高难推理和重工程用 Claude/GPT,走量和性价比用 DeepSeek/GLM/Sonnet 5,中文和合规场景用国产模型,前端视觉看好 Gemini。多模型统一接入平台便于灵活切换。

总结

2026 上半年,大模型行业以"半年 50+ 款、每月近 10 个"的残忍速度迭代:真实用量上国产模型集体爆发、前六霸榜,DeepSeek 领跑、GLM 增速最快;Anthropic 靠 Fable 5、Opus 4.8、Sonnet 5 的密集迭代闷声变强,却也面临用量落后和口碑争议;而安全限制过严的 Fable 5、屡屡跳票的 Gemini 3.5 Pro、进展不及预期的 Agent,构成了"降温"的一面。

一句话概括这半年:没有谁能一口气掀翻所有对手,多极格局下"按任务选模型"成为新常态。 本文数据来自 OpenRouter 年中排行榜及公开报道,模型排名与用量为动态数据、会持续变化,建议以各平台最新榜单为准。

 

延伸资源

 实时模型用量排行榜:openrouter.ai/rankings

 多模型对比测试与统一接入