Runway周一发布了Solaris,这是它称之为"界面世界模型"(Interface World Models)这一新类别AI系统的首个模型。这家公司的目标很直接:把"设计转代码"这个传统流程整个去掉,让视觉界面本身成为应用。
Solaris是一个实时交互模型,逐帧生成界面,通过观察用户的点击、拖拽等操作来决定下一步渲染什么。在Runway的设想里,这是通往一种新型操作系统层的早期一步——界面不再是预先写好的页面,而是实时生成出来的。
![]()
图像就是应用本身
传统视觉界面的工作流是:设计师画图,开发者把设计翻译成代码,再预先定义好各种交互逻辑。Runway认为这个环节完全可以跳过。Solaris把渲染和交互都交给模型处理——每一帧画面、每一次对用户输入的响应,都由模型实时生成。
用Runway自己的话说,"整个帧就是界面"。界面不再是页面的序列,而是一个持续生成的交互体验,"用户直接与场景本身互动"。
为了说明这个愿景,Runway给了几个例子:把一件衬衫从衣架上拖到你自己的照片上;在房间里移动家具;看着一碗沙拉随着你从配料堆里拖入食材而实时变化。
学习、推理、渲染,全部实时
Solaris建立在Runway的Gen-4.5视频生成模型之上,延续了其通用世界模型GWM-1的路径。它把用户的点击、拖拽等操作当作信号,用来生成下一帧。每次用户做出动作,模型就学习应该发生什么视觉变化,不需要为每个交互单独写代码。
Runway透露了几个技术细节:减少了去噪步骤的数量,让模型以自回归方式生成帧,并用模型自己的输出来训练,以在长时间会话中保持视觉质量。通过砍掉"设计转代码"这个实现步骤,用户看到的图像字面意义上就是应用本身。
Solaris还配了一个语言模型,用来把推理和渲染分开。语言模型负责理解用户请求、决定应用下一步该做什么、生成引导渲染的提示词;Solaris则负责实时生成对应的行为。
Runway还提出了一个观点:在传统编码界面上训练的智能体,遇到布局变化时往往难以泛化。而Solaris可以让智能体在不断变化的界面和从未见过的布局上训练。
整体来看,Runway的思路归结为三种新的软件能力:界面可以是视觉化的、"活的"、开放式的,持续对用户操作做出响应。代码翻译这一步,被整个拿掉了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.