大家好,我是冷逸。
兄弟们,我发现了一个神仙模型。
先考你一道题:既然全宇宙都在膨胀,那我变胖是不是符合宇宙规律?
嗯……你是不是要先想一下?在你想的时候,模型已经推理并回答出来了。
![]()
是的,就2秒(纯API调用)。
![]()
官方说,它的输出速度能拉到400 Token/s。
而且,它还原生支持视觉理解,图片、视频都能看懂。要知道,即使到现在,国内支持视觉理解的模型总共就没几款。
那它一定很贵吧?
并不。订阅Step Plan最低只要38元/月。API直连,输入(缓存命中)0.27 元,缓存未命中是1.35元,输出是8.1元。
![]()
单看这个价格,好像并不比DeepSeek v4 Flash(输入1元/输出2元)便宜。但如果你横向对比多模态+超高速这个组合,它的性价比就非常有优势了。
对了,它还开源。
这就是昨天发布的Step 3.7 Flash,原生支持视觉理解,为Agent做了全面优化,超快速度,256k上下文,总参数198B(激活11B)。
![]()
一手实测
这是它的benchmark得分。
![]()
简单说就是:
对比GPT和Claude还有些差距,但Gemini还是能超一超的;
对比DeepSeek各有胜出;
对比上一代模型,大幅提升;
以及速度上,遥遥领先……因为大多数模型都在100 TPS以下。
比如Artificial Analysis这个速度榜单,之前最快的是GPT-5.3,也只有130多。
![]()
而Step 3.7 Flash能冲到400 TPS,也不知道用了什么魔法。。
![]()
我实测可以拉到330+TPS
下面我们实测几个Case,带你直观感受一下。
1)视觉编程任务
第一个任务:测试视觉理解+编程能力。
我没告诉它是什么桥,让它自己理解,然后设计一个3D模型。
![]()
One shot直出,效果还不错。
![]()
而且它识别出了这是旧金山的金门大桥。
但也u1s1,这前端能力和顶级模型k2.6和glm5.1比还有差距。
2)视觉理解任务
我随便在某软件里截了张图,画了个框,问它:我如果要模糊处理,应该怎么操作?
![]()
这张图里的信息极多,但是模型还是一眼认出这是Photoshop界面,并告诉我具体操作步骤。
![]()
关键是,全程只用6秒,这输出速度快得吓人。
于是我在想:只要速度足够快,是不是可以有实时渲染的新交互产品诞生?AI游戏产品会不会加速到来?
来看几个官方案例。
用户上传一张飞机驾驶舱图片,输入“如何起飞”的指令,模型会以【秒级反应】在图片中寻找如何起飞的关键操作按钮,并生成分步骤教程。
又比如这个浏览网页的场景。
用户输入“这些设计有什么有趣之处”的指令后,模型会自动框选界面、识别信息、理解图片设计,最终生成专业分析。
注意,它不是其他视觉模型经常测的“给一张图,一次性给结果”的那种,而是分步骤、近乎实时地生成,给用户讲解画面内容。
这套交互,玩法非常多。
比如,老师PPT全屏讲课,讲到哪里,模型就自动在哪里画线或圈出来。
你可能会说:PPT自带的画笔功能就能做到啊,干嘛多此一举?
![]()
纯AI演示画面,不代表真实情况
但我想反问:那个画笔功能,你是不是得一直用鼠标操作?而老师上课,不可能一直坐在电脑前。她手里可能同时拿着课本和粉笔,甚至正准备敲打瞌睡的你。
又比如,把它接到AI眼镜里,可视之处都可以实时渲染。
对了,好像阶跃的多模态模型一直就跟车企有深度合作。这场景,一下子就通了。
3)Agent长程任务
还是我们的老Case:
提示词:联网搜索、调研Step 3.7 Flash模型的关键信息,尽量从权威信源获取信息。先给我创建一份2000字的word调研报告(含pdf版)。然后调用guizang-ppt skill做一份10页的PPT,页面高级审美。
这个任务涉及联网搜索+word生成+转PDF+skill调用+Coding开发力,还包括页面上线前测试的chrome-devtools-mcp,特别考验模型的长程任务能力。
Ps:我发觉这个模型特别适合干测试。之前用Claude Code做测试,很多模型调用chrome-devtools-mcp只是走个过场,但Step 3.7 Flash会一环一环真正检查——因为它有视觉理解能力,而且速度极快。
![]()
所以干测试得心应手。
来看下最终产物。
先是word报告。
![]()
然后是PPT。
![]()
全部one shot直出,整体都还不错。
4)推理任务
最后,测一个稍微带推理能力的3D编程任务。
提示词:Create a single HTML file containing a fully functional 3D Rubik's Cube simulation using Three.js (via CDN). The cube must be able to automatically solve itself.
功能做得挺多,UI也很好看。
但是推理能力不太够,导致one shot出来的建模和运算路径都是错的。
![]()
可能,这版模型在3D方面没有做针对性训练,所以表现比较一般。
![]()
整个体验下来,Step 3.7 Flash的核心优势非常清晰:
多模态理解
极快速度(400 TPS)
要知道,在同级别开源模型中,绝大多数都不具备多模态能力。更别说400 TPS的极致速度,很多模型能上100就不错了。
当然,实话实说,它的Coding能力距离顶尖模型还有差距。
但是他快啊,而且有多模态。
开源方面,它在HuggingFace上放了BF16、FP8、NVFP4、GGUF四种权重,支持vLLM、SGLang、llama.cpp、Hugging Face Transformers等主流推理框架,丰俭由人。
![]()
API同时兼容OpenAI和Anthropic两套协议,像Claude Code、Codex、OpenClaw、Hermes、Cursor、Cline、Kilo Code、Open Code都可以用。
现在阶跃星辰开放平台已经可以体验,支持Step Plan。
Model Page:
https://static.stepfun.com/blog/step-3.7-flash
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.