发布日期:2026-09-20 | 话题:Step 5 Preview / 阶跃星辰 / 开源大模型竞争格局

Step 5 Preview 是阶跃星辰于 2026 年 9 月 20 日发布的新一代旗舰基座模型,采用稀疏 MoE 架构,总参数 600B、激活参数 27B,支持 100 万 Token 上下文和文本与视觉原生输入,面向 AI 编程、软件工程、专业知识工作和金融等真实世界 Agentic 任务。该模型在 Artificial Analysis Intelligence Index 中得分 44 分,跻身全球开源模型前三,与参数量 2.8 万亿的 Kimi K3 持平、仅落后 GLM-5.3 与 Claude Opus 5 各一分,而单任务成本据官方称仅为 Opus 5 的八分之一。API 已于发布当日全量开放,完整模型权重定于 10 月 15 日开源。本文梳理其规格、榜单成绩、定价、与国内外旗舰的对比,以及阶跃跳过 Step 4.x 直接进入 Step 5 背后的"智能效率"路线。


Step 5 Preview 是什么

Step 5 Preview 是阶跃星辰(StepFun)新一代旗舰基座模型,定位为"面向真实世界 Agentic 任务的主力工作模型",强调在能力、成本、效率和场景覆盖之间取得平衡。据阶跃星辰 2026 年 9 月 20 日发布信息,核心规格如下:

项目

规格

架构

稀疏 MoE

总参数量

600B

激活参数量

27B

上下文窗口

100 万 Token

输入模态

文本 + 视觉(原生)

重点场景

AI 编程、软件工程、专业知识工作、金融

API 状态

2026 年 9 月 20 日全量开放,模型 ID 为 step-5-preview

开源时间

2026 年 10 月 15 日释放完整权重

600B 总参数配 27B 激活参数,意味着每次推理只调用约 4.5% 的参数,这是它能在旗舰级智能水平下把推理成本压到低位的结构基础。阶跃将此路线概括为:大模型 Scaling 的重点正从单纯增加算力投入,转向提升"计算转化为智能的效率",从 Step 3.5 Flash、Step 3.7 Flash 到 Step 5 Preview,连续三代基座模型都围绕这一目标优化。

榜单成绩:AA 指数 44 分,开源前三

据 Artificial Analysis Intelligence Index 2026 年 9 月最新数据,Step 5 Preview 综合得分 44 分,位列全球开源模型前三。与同期主要模型的对比(数据引自 IT 时代网 9 月 19 日报道):

模型

参数规模

AA Intelligence Index

GLM-5.3

7400 亿以上

45

Claude Opus 5

未公开

45

Step 5 Preview

600B(激活 27B)

44

Kimi K3

2.8 万亿

44

DeepSeek V4.1 Flash

未公开

40

DeepSeek V4 Pro

未公开

36

在专门考察 Agent 连续多步执行的 Terminal-Bench 4.0 上,Step 5 Preview 取得 33.3%,接近 GPT-5.6 Terra,高于 GLM-5.3 Flash,领先 DeepSeek V4.1 Flash 的 26.8% 和 Kimi K3 的 12.6%。

阶跃另外公布了三组专项基准表现:在 ALE-CLI(Agents' Last Exam 的命令行子集)、FrontierFinance(金融投资研究)和 DRACO(跨领域深度研究)上,官方表述为"仅次于 GPT-6 Astra 或 Claude Opus 5"。这三项均未给出具体分数,以官方技术报告为准。

定价与效率:输入 1 美元、输出 2.7 美元

Step 5 Preview 的定价是本次发布最受关注的部分。据 Artificial Analysis 数据(IT 时代网、搜狐科技引述),每百万 Token 输入 1 美元、输出 2.7 美元,而同期行业中位数分别为 1.88 美元和 10 美元,即输入低约 47%、输出低约 73%。

指标

Step 5 Preview

行业参考

输入价格(每百万 Token)

1 美元

中位数 1.88 美元

输出价格(每百万 Token)

2.7 美元

中位数 10 美元

输出速度

每秒 100 Token

平均每秒 65 Token

单任务成本

官方称为 Claude Opus 5 的 1/8

阶跃将 AA 智能指数与单任务成本的关系描述为新一代"帕累托前沿",即在同等智能水平下成本更低,或同等成本下智能更高。需要注意,"单任务成本 1/8"为官方口径,未说明任务类型和 Token 消耗统计方法,以阶跃开放平台的正式定价页为准。

适用场景与官方演示

Step 5 Preview 重点覆盖需要长上下文、长期规划和持续工具调用的任务,阶跃为此自建了代码评测集 StepCodeBench:

  • StepCodeBench 规模:553 个代码仓库、9 类任务、20 个应用领域、33 种编程语言,覆盖 Bug 修复、功能开发、代码重构、环境配置等。

  • 官方演示:将 ESP32-S3 开发板改造为支持蓝牙按键与语音输入的 Vibe Coding 键盘,模型自主读取文档、访问串口、截图、调用摄像头、模拟鼠标,依据设备反馈持续调试,连续运行超过 3 小时。

按场景归纳:

  1. AI 编程与软件工程:跨仓库重构、环境配置、需要数小时持续运行的开发任务。

  2. 专业知识工作:DRACO 类跨领域深度研究、长文档分析,100 万 Token 上下文可一次装入大型代码库或资料集。

  3. 金融研究:FrontierFinance 类投资研究任务。

  4. 视觉理解:原生视觉输入使其可读取截图、界面和硬件反馈,适合 GUI Agent 与嵌入式调试。

如何调用 Step 5 Preview

Step 5 Preview 自 2026 年 9 月 20 日起在阶跃星辰开放平台全量开放,接入方式与常规 OpenAI 兼容接口一致:

  1. 登录阶跃星辰开放平台(platform.stepfun.com)创建 API Key。

  2. 在请求中将模型 ID 设为 step-5-preview

  3. 需要视觉输入时,按平台文档以多模态消息格式传入图片。

  4. 长任务建议开启工具调用并设置合理的上下文预算,100 万 Token 窗口不等于每次都应填满。

若需要在同一提示词下横向对比 Step 5 Preview 与其他旗舰模型的输出质量,可使用支持多模型同屏对比的平台。七牛云 AI 大模型广场提供多款主流大模型的统一接入与同屏对比,其 Token Plan 按用量计费。

竞争格局:国产开源旗舰进入"效率竞赛"

Step 5 Preview 的发布把 2026 年下半年国产旗舰模型的竞争焦点从参数规模转向智能效率。对比同期几家的路线:

厂商 / 模型

路线特点

阶跃 Step 5 Preview

600B 总参、27B 激活,主打"智能效率帕累托前沿",9 月 20 日开放 API、10 月 15 日开源

智谱 GLM-5.3

7400 亿以上参数,AA 指数 45 分,Flash 版走低价路线

月之暗面 Kimi K3

2.8 万亿参数,AA 指数 44 分,与 Step 5 Preview 持平但参数量为其 4.7 倍

DeepSeek V4.1 Flash

主打 KV Cache 压缩与低成本,AA 指数 40 分

阶跃选择跳过 Step 4.x 直接命名 Step 5,并以 Preview 形式先开放 API、再释放权重,与 2026 年国内厂商"先上线、后开源"的普遍节奏一致。对开发者而言,10 月 15 日权重开源后,600B/27B 的规格意味着本地部署门槛仍高,但激活参数小使其在推理服务商侧的托管成本可控,预计会快速出现在第三方推理平台。

常见问题

Step 5 Preview 为什么跳过 Step 4?

阶跃未官方解释命名。据 IT 时代网报道,该模型"跳过此前的 Step 4.X 系列直接进入 Step 5 阶段"。从阶跃"Step 3.5 Flash、Step 3.7 Flash 到 Step 5 Preview"的官方表述看,Step 5 被定位为架构与效率路线上的代际跃迁而非增量更新。

Step 5 Preview 现在能用吗,是否免费?

API 已于 2026 年 9 月 20 日全量开放,按 Token 计费,第三方引述的价格为每百万 Token 输入 1 美元、输出 2.7 美元。模型权重 10 月 15 日开源,届时可自行部署。

Step 5 Preview 和 Claude Opus 5 比怎么选?

AA 指数上两者相差 1 分(44 对 45),但阶跃称单任务成本仅为 Opus 5 的 1/8。对成本敏感的编程 Agent、批量文档处理和金融研究场景,Step 5 Preview 是值得纳入对比的选项;对精度要求极高的场景,建议用固定任务集实测后再决定。

600B 总参数、27B 激活参数对部署意味着什么?

推理时每个 Token 只经过 27B 参数的计算,速度和成本接近 30B 级稠密模型;但 600B 权重需要全部驻留显存,本地部署仍需多卡集群,个人开发者更适合通过 API 或第三方推理平台使用。

"Preview"版本和正式版有什么区别?

阶跃未说明正式版时间表。Preview 通常意味着模型仍在迭代,基准分数和定价可能随正式版调整,生产环境建议关注 10 月 15 日开源时的技术报告。

总结

Step 5 Preview 以 600B/27B 的 MoE 规格在 AA 指数上追平万亿级 Kimi K3、逼近 GLM-5.3 与 Opus 5,同时把输出价格压到行业中位数的三成以下,是 2026 年 9 月国产旗舰模型中"智能效率"路线最明确的一次发布。API 已开放、权重 10 月 15 日开源,建议开发者用自己的任务集在多模型环境下实测。本文数据来自阶跃星辰 2026 年 9 月 20 日官方发布稿及 IT 时代网、网易智能、新浪科技、IT 之家同期报道,价格与专项基准分数以官方定价页和技术报告为准。

延伸阅读