茉莉花
新闻网
2026-09-21 · 星期一近12小时收录 56 条最近更新 04:27

快讯马克龙十年来首访圣皮埃尔密克隆 会晤卡尼谈法加合作

实测阶跃Step 5 Preview 编程金融多任务表现亮眼

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
爱范儿
原文作者
莫崇宇
原文发布
本站收录

9 月的大模型战场之激烈,没有谁能稳坐钓鱼台。

除了榜单上的排名厮杀,各家还要比拼的,还有「庖丁解牛」般的实战功夫。

模型能否处理越来越复杂的真实任务,响应能否满足真实场景的即时需求,成本能否支撑大规模调用,以及能力能否真正进入手机、汽车等终端设备,正在成为衡量一家基模公司的行业金线。

今天,旗舰模型又杀出一匹黑马。阶跃星辰发布了新一代开源旗舰基础模型 Step 5 Preview。

f026d61a9e0ef6418f18570dfde05912180f0721fa45858ffa453caf44662df2 article

在全球权威的 Artificial Analysis Intelligence Index 中,Step 5 Preview 取得 44 分,位居全球开源模型前三,同时进入模型智能水平与单任务成本权衡的「帕累托前沿」,即让模型在能力、效率、成本之间实现最佳平衡。

68e420a0426d447a806e875ed5726a74785d1bcca72b5a7e36a0ada4da3c940c article

9fcdc250c1055210ea4a3d1a9dce418711a08c13405cc5a669f60e8459110525 article

APPSO 一轮实测下来,发现阶跃悄悄杀回了国产大模型牌桌的头部玩家行列。

实测 Step 5 Preview ,阶跃开始兑现更大的野心

Step 5 Preview 重点面向 AI 编程、软件工程、专业知识工作、金融等场景,擅长处理需要长上下文、多轮工具调用与持续执行的真实工作任务。

Step 5 Preview 模型采用稀疏 MoE 架构,总参数量为 600B,实际激活参数仅 27B,原生支持文本与视觉输入,上下文长度达到 1M。

我们直接通过 WorkBuddy 接入模型,覆盖编程、设计、3D 生成、深度调研和数据分析,看看实际表现如何。

编程测试从简单 Three.js 五子棋测试开始,落子、轮次切换和胜负判定,构成小游戏最基本的功能框架。Step 5 Preview 生成的小游戏甚至还有人机对弈环节。

202ad612d10910a9648b18d365022836ffa80ebf065824fe38d90f9fccd0f563 article

在威尼斯快艇游戏案例中,Step 5 Preview 不仅完成了主要玩法,还把水面、建筑与镜头运动组织在同一个场景里,最终效果已经接近可以直接体验的网页小游戏。

f07466558180a62d1aefd32ac4436b73fbcb626b18c444fc8fc232e71f3273cf article

卡帕多奇亚热气球场景进一步提高了复杂度。

数十个气球需要同时飞行,日照、风向和观察视角均可调整,视觉表现与运行效率也要兼顾。面对多个彼此关联的变量,Step 5 Preview 仍然保持了较完整的场景结构和交互逻辑。

98893282511f7cbfb42de527f23699a694ab33f8333a3d2beef418b508313dea article

我们还让 Step 5 Preview 以 Three.js 尝试还原尼亚加拉瀑布,面对动态水体、水雾、彩虹、游船、多视角和季节切换等高密度要求,它依然兼顾了视觉效果、交互逻辑与运行效率,整体完成度相当亮眼。

网页操作系统也是一个颇有参考价值的横向样本。

此前,我曾用 DeepSeek V4 Pro 和 DeepSeek V4.1 Flash 测试过相同类型的 Mac 操作系统任务,而 Step 5 Preview 此次交出的页面在界面完整度、功能衔接和细节还原上都更进一步,整体完成度明显更高。

eedf01cc6f5557555350f2dba1e02e90cff12a995f3843576f83c9bfcf9da217 article

网页设计和 3D 资产测试进一步考察视觉理解与空间表达。

太空行星和夜间跑车两个主题都提供了明确的视觉中心。模型需要将构图、文字可读性与移动端适配落实在同一个页面中,最终结果也能看出 Step 5 Preview 对视觉层级和页面氛围的理解。

e8f5da5e3e38d3358dcb0b1868704514fc21ea68a79595c6132006f2399f6a16 article 7f0ffbf92a07c7c392a066097a12d7f838fdab83fa98597060214954941bf353 article a61bdf117c1e7900c9d73b911ddd6a1ff8e4da8441f84442c99cf53d1909c710 article

3D 资产测试我选择了狮身人面像,Step 5 Preview 也能轻松抓住不同对象的结构特征,并将其转化为空间表达。

a5aa196a794124b2c351c2b74992adb29396fa0bc9c35f27f36f043445132104 article

面对一张我随手拍摄的照片,它也能在数分钟内还原出具备基本结构和空间细节的模型。

211ad67f90fe7854dac4dca894ba4ee21a63b5d25fb41cffc434c6a5b685a104 article

▲ 左为原图,右为成品

相比创作任务,深度调研更考验证据组织、专业知识与判断能力,金融则是检验模型综合能力的典型场景。

阶跃围绕公司研究这一高难度的金融工作流构建了三项内部评测,并引入包含 220 道专家问题、11543 项评估标准的 FrontierFinance。官方结果显示,Step 5 Preview 在四项金融基准中的表现均接近 Claude Opus 5,在信息检索、企业估值和金融研究等任务上具备强大的能力。

回到 APPSO 的实测,小折叠手机立项报告同样要求模型串联用户投诉、外屏生态和售后成本,最终给出有依据的产品建议。任务的难点在于,模型既要查找和整理资料,也要从分散信息中提炼出能够影响产品决策的结论。

79f54b5875b76e4fba99d3e0f4a6dbc8a20317b4beb5e183e4bea24bbda62a81 article

广州、佛山七日游同时加入预算、体力和严格素食限制,考察模型能否在完整行程中持续遵守多重条件。此类任务看似生活化,却很容易因为行程变长而遗忘限制,Step 5 Preview 不仅持续遵循约束条件,方案也有更高的可行性。

a82238a48cca25727c363af44c8f78e8b47b59deb8c5db03e65e5c137bd3a291 article

销售明细表分析进一步贴近企业日常。模型需要先清洗混乱数据,再追踪负利润率订单集中的大区与品类,最后生成月度销售趋势图。处理过程是否清晰、结论能否复核,直接决定交付物能否进入真实工作流。

389e917cd6ccd26a6b4b55e015ef0fe6794a334a83fde02ea4b49d8aac6e135c article 721afe8fb25cafe90b1b34c75b67959e9c6db8522b7a6bbb5d3349f03d15417a article

从网页游戏、3D 资产到金融研究和数据分析,这些案例显示,Step 5 Preview 已经能够理解复杂需求、规划执行步骤、调用工具并持续遵守约束,最终交付可以运行、阅读或继续使用的成果。

Agent 浪潮将至,阶跃手里有什么牌

如果说 Step 5 Preview 验证了阶跃研发前沿旗舰模型的能力,那么全模态基座模型矩阵的布局,则让阶跃的模型具备了从感知、理解、生成到交互的完整能力链路,能够处理真实世界中的多元和复杂信息。

这既为复杂 Agent 提供了更完整的技术底座,也拓宽了阶跃面向不同终端、应用场景和产业需求的发展空间。

过去一个季度,阶跃陆续推出 Step Edge 端侧模型和 StepAudio 3 系列语音模型,而端侧模型 Step Edge,通过文本与视觉基础模型结合语音、GUI 和生成能力,支持简单任务在端侧完成、复杂任务交由云端处理,并在评测汇总中取得 29 项第一。

上周,刚发布的 StepAudio 3 Realtime 在 Aritificial Analysis 对话动态和语音推理测试中分别取得 98.9% 和 99.7%,StepAudio 3 ASR 则以 1.7% 的词错误率并列非流式语音识别全球第一。

0f4f11e56857c65b4aa48c9b0d04fdede794c58367f4ef8c3bee0964b154634c article

目前,阶跃的模型布局已经覆盖云端旗舰、Flash 高效模型、端侧模型,以及语音、视觉、生成、GUI 等多模态专项能力的完整矩阵。既能向上攀登模型上限,也能向下进入真实 Agent 和终端场景。而让阶跃更有辨识度的是 AI+终端的落地场景,在国内同时集齐这三种要素的大模型公司屈指可数。

官方数据显示,其模型手机装机量已超过 4200 万台,日均服务近 2000 万人次,合作覆盖国内超过 50% 的头部手机品牌,应用场景包括识屏问答、智能搜索、内容生成和跨应用任务执行。

汽车方面,阶跃与吉利、千里科技共同研发整车智能体超级 Eva,并由极氪 8X 首发搭载。

超级 Eva 接入了 Step 3.5 Flash 基座模型及阶跃的语音和视觉理解模型,将感知、推理与执行能力整合进同一套车载智能体系统。吉利银河 M9 也通过接入阶跃端到端语音大模型,实现业内首次同类模型的量产上车。

54b2b9be527c4dcac565c140722c6f9456f3fb034712749aa21008f5254ada2b article

如果只把这些合作理解为装机规模,仍然低估了终端对于一家基础模型公司的价值。

数千万台终端既是一场每天进行的开放世界测试,也让模型能够在口音、噪声、模糊指令和网络波动等真实场景中持续获得高价值反馈,并帮助阶跃积累面向高频终端 Agent 的「智能密度」。

终端同样是验证端云协同与全模态 Agent 的天然场所。Step Edge 与 Step 5 Preview 可以覆盖端侧效率和云端能力,语音、视觉、GUI 操作与任务结果则在真实交互中不断磨合。

相比主要依赖开发者调用和线上评测的纯 API 模型公司,阶跃能够把模型能力送入具体设备,再通过系统适配、产品交付和用户使用,缩短技术能力转化为商业价值的路径。

上述积累之所以重要,还在于 Personal Agent 很可能成为 Coding Agent 之后,全球 AI 产业的下一波浪潮。

Personal Agent 需要理解屏幕、声音、环境和个人偏好,还要跨应用完成真实任务,因此会对长期上下文、全模态感知、GUI 操作和端云协同提出更高要求。而它的核心入口载体,就是 AI 原生硬件。

9b3538fb73ab94a92fa6f5d593d7560c7a8ac8f4dd88188249f5e7d43777e702 article

正如苹果 CEO 特努斯(John Ternus)所描绘的,未来的 iPhone 终端设备将成为「智能个人中枢」。

手机和汽车恰好是距离用户最近的入口,当下的阶跃已经围绕这些入口提前布局。不仅如此,今年 7 月,阶跃推出了大模型原生 AI 终端品牌 STEPX,并即将带来大模型原生智能体手机 STEPX Neo。

这意味着阶跃构建起从模型、系统到终端的『模软硬』三位一体技术闭环,提前拿到 Personal Agent 这场战役的入场券。

至此,前沿基座模型抬高能力上限,全模态矩阵覆盖感知、理解与交互,数千万台设备承接规模化应用。三条能力线相互协同,让阶跃重新跻身基础模型公司第一梯队,也获得了更大的行业话语权。
百川终需东去,江河总要入海,大模型最壮阔的归宿,终究是汇入千千万万人的无边人海。
更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]