阶跃Step 5 Preview发布:AA榜开源前三、成本仅Claude Opus 5的1/8,权重10月15日开源

新闻3周前更新 ai30guanwang
16 0

9月20日,据IT之家报道,阶跃宣布推出旗舰模型Step 5 Preview,面向AI编程、软件工程、专业知识和金融场景,并定档10月15日开源完整权重。这份发布有几个数字值得单独拎出来说:总参数量600B、激活参数只有27B的稀疏MoE架构,100万Token上下文窗口,原生支持文本与视觉输入;在Artificial Analysis智能指数上拿到44分,位列全球开源模型前三;单任务成本只有Anthropic Claude Opus 5的1/8。开源、便宜、能打,三个词凑在一条发布里,含金量就不一样了。

阶跃Step 5 Preview发布概念封面图
开源榜上又多了一个狠角色(配图:AI30媒体部)

开源前三,是怎么排出来的

先说榜单。AA综合智能指数(Artificial Analysis Intelligence Index)是海外比较有公信力的第三方评测,Step 5 Preview拿到44分、挤进全球开源前三,意味着它不是「国产开源里不错」,而是放在全球开源池子里也能站住。细节上,阶跃为它建了一个自建的评测集StepCodeBench:553个独立代码仓库、9类任务、20个应用领域、33种编程语言,覆盖Bug修复、功能开发、代码重构、环境配置这些真实开发里躲不掉的活儿。在公开与内部评估中,它在复杂软件工程(包括长程规划)、专业知识和金融基准上表现均衡,在ALE-CLI、FrontierFinance、DRACO这几项上仅次于GPT-6 Astra或Claude Opus 5——注意是「仅次于」,不是「落后一大截」。

600B只激活27B:钱要花在刀刃上

稀疏MoE这手牌今年各家都在打,但Step 5 Preview把账算得更狠:总参数600B保证了能力上限,激活27B把单次推理的成本压下来,落到用户侧就是那句最直观的对比——单任务成本是Claude Opus 5的1/8。对企业采购来说,这才是能拍板的数字。再加上100万Token上下文和原生视觉输入,长文档分析、多模态工单处理这类场景不用再做切片预处理。从千问到智谱再到阶跃,国产模型的竞争已经从「跑分追赶」转向「单位成本下的真实任务表现」,这个转向对下游用户是实打实的好事。

把开发板改成蓝牙键盘,才是这次最狠的演示

发布里最出圈的演示不是跑分,而是这么一件事:给模型一段自然语言需求,它自主阅读ESP32设备的开发文档和API,把一块ESP32-S3开发板改造成支持蓝牙按键与语音输入的Vibe Coding键盘。过程中它能访问串口、获取截图、调用摄像头、模拟鼠标操作,根据真实设备返回的状态和报错持续修改、运行、调试,连续执行超过3小时。这基本是Agentic能力的「泼冷水现场」——不给你干净的沙盒,给你真实的硬件、真实的报错和真实的等待。能在这种环境里连续干三个小时不出局,比榜单名次更能说明工程化程度。

开源权重10月15日到,对GEO有什么影响

10月15日权重放出后,Step 5 Preview大概率会出现在各家私有化部署清单和一批垂直 Agent 的底层里。对做GEO的人来说,这是引用来源池的又一次扩容:开源模型被本地化部署后,训练数据截止时间内的权威内容、结构清晰的技术文档、带具体数字的评测稿会更吃香——本地部署的小模型没有实时搜索兜底,对内容「可引用密度」的依赖反而更强。所以与其纠结它的榜单排名,不如检查一下自己的核心页面,是不是每段关键内容都能被独立引用、数字都有出处。开源模型的每一次扩容,都是一次内容资产的重新定价。

(文 / AI30媒体部 | 最后更新:2026年9月20日)

© 版权声明

相关文章

暂无评论

none
暂无评论...