网易首页 > 网易号 > 正文 申请入驻

开源国产8B模型,比肩闭源Image 2了!

0
分享至

金磊 发自 凹非寺
量子位 | 公众号 QbitAI

时隔仅仅三周,国产生图模型,又进化了。

上回书到,这个生图模型是4K直出的,开源的,只有8B大小的。

这一次,它的正式版本来了!若是用三个词来概括,那就是——

更完整,更准确,更稳定。

例如我们现在一口气把九张不同的食物照片丢给它:



并简单附上一句Prompt:

请将这九款美食拼成一张精美的食谱分享卡片。



原本各自拍摄、比例和背景都不一样的九张图片,一下子就被整整齐齐地设计到了一张图里;并且AI还精准识别出了每道菜品,同时还给它们适当加了美化处理,让图片整体变得更加养眼。

再来看一个编辑图片的例子。

我们在原图的基础上,用“框选+标注”的方式,把想要修改的图片局部细节给标了出来:



AI在接到任务改完以后是这样:



可以明显看到,几个目标区域都按照要求发生了变化,但床、床头柜、玻璃杯、右侧柜体,包括整个卧室原来的空间关系都基本保留下来。

而这个AI,便是商汤科技这次正式开源的SenseNova U1.5 Lite,其亮点如下:

  • 3-4k字符超长复杂指令遵循:能一次理解更长、更复杂的要求,同时处理主体、数量、位置、文字、布局和风格等多种约束,不容易漏细节。
  • 更高质量的视觉生成:构图、色彩、材质、光影和细节更自然,整体完成度更高。
  • 更可靠的原生图像编辑:改指定内容时更精准,同时更好地保持人物、结构、版式和其他区域不变。
  • 更好的文字与复杂布局:中英文文字、海报、信息图和多文本排版更准确,也更擅长组织复杂画面。
  • 更精细的视觉控制:支持框选、标记和多图参考等方式,更准确地指定“改哪里、改什么”。
  • Native 4K高分辨率输出:直接生成4K高清图,同时保住构图、纹理、小字和光影等细节。

而且啊,SenseNova U1.5 Lite依旧保持了8B的大小,还能在复杂排版与精准编辑等核心的场景上比肩闭源的GPT-Image-2:



如果说三周前的SenseNova U1.5 Lite Preview版本是验证一个统一模型能够把视觉能力扩展到哪里。

那么到了今天的正式版本,商汤科技则是进一步验证这些能力能否分别得到强化,再重新统一到一个轻量级模型中,并稳定进入真实创作流程。

效果怎么更强了?看细节

接下来,我们继续拿效果来说话。

第一个任务,先来一个考验信息组织能力的实测,主题是从可可豆到巧克力。



要在一张竖版信息图里,需要同时塞进Harvesting、Fermentation、Roasting、Grinding、Tempering到Finished Chocolate六个阶段。

每个阶段既有文字解释,也有对应的可可果、发酵箱、烘焙设备、研磨装置、巧克力浆等视觉元素,而且六层内容还得顺着版式一路往下走。

从最终的效果来看,SenseNova U1.5 Lite已经做到了可以组织一整套视觉表达,包括长文本、多层级结构、插画、数字顺序和版式关系。

这种能力再落到更日常的内容生产里,就变成了类似做社交媒体封面这类任务。

比如下面这张图:



这类图看上去虽然元素不算多,但难点就在于要做到“封面感”这三个字。

标题要立得住,主体要足够抓眼,三只狗的造型、服饰和表情既要各有区分,又不能彼此打架;同时,整张图还得维持住统一的时尚调性,而不是变成几个可爱元素拼在一起。

从最后的结果来看,正式版在这类应用型视觉任务上,已经开始更接近一张能够直接拿来用的封面作品。

接下来,我们再来看下SenseNova U1.5 Lite的局部编辑能力。

Prompt是这样的:

仿照参考图的折纸拼贴视觉,生成一张社区共享厨房运营模式信息图。



乍一眼看过去,两张图片整体的结构和风格几乎是没有变化的,因为我们的要求就是“仿照参考图”。

仔细看细节,原来属于教育项目的元素被替换成厨师帽、砧板、菜谱等厨房相关视觉,左侧的信息也跟着变成Membership Fees、Commercial Rental、Cooking Classes、Market Sales和Event Hosting。

在这类任务中,模型得先分辨出一张图里哪些东西属于主题内容,哪些东西属于更底层的设计逻辑。然后保留后者,再让新内容沿着原来的视觉语言长出来。

不过若是参考图从一张变成了多张,那任务难度就会更大了。

例如我们输入下面这三张参考图片:



然后附上这样的Prompt:

Edit Image1usingImages2and3ascontentreferencesrather than pasted rectangular images. Replace the framed band silhouetteswithallfive Radiohead membersfromImage2, transformedintothe poster’s distressed monochrome halftone style. Reflow the four lower feature blocksintoa compactleftcolumnandaddan ESSENTIAL LISTENING listontherightusingImage3onlyforwordingandhierarchy. Render thenewlist directlyonthe same continuous black distressed backgroundwithmatching off-white type; donotretainanywhiteorcream card background. Preservealloriginal textandallother poster elements.

这次Prompt更细节的一点是,第三张参考图只允许参考内容和信息层级,原来的白色卡片背景不能一起搬过来,新歌单需要直接长在海报原来的黑色做旧背景上。

SenseNova U1.5 Lite给到的结果如下:



从结果来看,Radiohead五个人进入了原来的乐队区域,人物处理后的质感和整张海报基本接上了;左下方的信息重新压缩,ESSENTIAL LISTENING则直接融进右侧版面,没有留下一块突兀的白底。

而对于刚才给到的三张参考图来说,第一张负责版式和风格,第二张负责人物身份,第三张只负责文字内容和结构。模型必须先把这三件事分开理解,最后才能重新合成到一张图里。

但在真实设计工作里,还有一种需求没有前面这么复杂,却可能出现得更频繁——改几个字

这次我们在输入原始图片后,Prompt如下:

请将左下角深蓝色矩形信息栏内的展览时间与地址详情,从
“JUNE 15 - JULY 30, 2024
URBAN GALLERY
123 CREATIVE WAY
ARTSVILLE, USA”
替换为
“AUGUST 10 -
SEPTEMBER 28, 2024
METRO MUSEUM
456 DESIGN ROAD
CREATIVITY CITY, UK”,
保持原有的白色与粉色字体样式及排版布局不变。



最终,左下角的信息完成替换,画面中心巨大的“RHYTHM OF FORM”、周围高饱和度的几何图形,以及原本的文字层级都留在原来的位置。

先拆开练,再合回来

在看完的效果之后,接下来的一个问题就是,一个8B模型是如何做到文字、审美、复杂布局、长指令、局部编辑都过关的?

据了解,SenseNova U1.5 Lite继续沿用了NEO-unify原生统一多模态架构,把视觉理解、图像生成和编辑放在同一套模型里。

也就是说,在真正动像素之前,模型先要理解画面。

哪里是主体,谁在谁旁边,哪些是文字,用户指的是哪块区域,一张参考图里到底哪些东西值得保留……这些理解过程,并不会和后面的生成、编辑彻底分家。

而正式版这次比较关键的一处变化,发生在训练阶段。商汤采用了一套很容易理解的办法:先拆开练,再合回来。

文字渲染、美学表达、图像编辑这些目标,先会分别训练对应的专项Expert

等这些Expert练完以后,再通过多教师在线策略蒸馏技术MOPD,把它们的专项能力重新融合回同一个SenseNova U1.5 Lite里。

所以训练时虽然有多个专项老师,到了最后真正交付和部署的时候,用户拿到的依然只有一个8B模型。

没有额外Router在背后判断“这次应该调用哪个子模型”,用户也不用在文字、美学、编辑几个模型之间自己来回切。

这种做法和前面的案例其实是能对上的。

比如Radiohead那组多参考图任务,模型先得理解原海报的视觉骨架,再识别人物,还要从另一张图里提取文字结构,最后才能完成生成。

到了海报改字也是一样。

“只改左下角”首先得先理解什么叫“左下角”,哪些文字属于目标区域,周围哪些图形、字体和版式不能动。等这些判断做完,才轮到最后的像素生成。

所以在统一训练体系里,视觉语义理解和空间建模形成的结构化认知,可以继续反过来帮助生成和编辑。商汤在新闻稿里把这件事概括为“理解与生成双向反哺”。

而要让这种能力在复杂任务里稳定下来,正式版后训练又专门强化了三件事。

第一件叫指令遵循。用户写了一大串要求,主体有几个、谁在左边、文字放哪儿、什么颜色、哪些东西不许改,最后模型到底执行了多少。

第二件叫视觉偏好。指令都完成以后,整张图的构图、材质、光影和最终质感到底过不过关。

第三件是编辑保持。要改的区域能不能改准,原本已经正确的地方还能不能留下来。

这三项其实刚好对应了前面几个案例最容易出问题的地方:复杂信息图怕漏要求,STYLE这样的封面直接考验美学完成度,而卧室修改、Radiohead和文字替换,则都离不开对非编辑区域的保持。

另外还有提示词增强。如果用户只给一句比较简短的需求,PE可以先帮忙把意图整理成更完整的创作方案,再交给U1.5 Lite执行。

以上便是正式版SenseNova U1.5 Lite背后的技术关键了。

生图模型的标准,得变了

若是把时间线拉长一些,回头再看SenseNova U系列这几次变化,其实我们会发现一个比较明显的趋势。

早期大家看生图模型,最容易比较的是够不够惊艳。但当AI的生图能力越发的普及,真正决定模型能不能进入工作流的问题,开始出现在第一张图生成以后。

这也是SenseNova U1.5 Lite正式版反复强调“稳定”的原因。相比再增加几个看起来新鲜的玩法,它更想解决的是一项视觉任务从生成到交付的完整链路。

对应地,评价模型的标准也在发生变化。一张图够不够漂亮依然重要,但真正拉开差距的,越来越可能是模型能不能从理解需求、生成内容,一路完成修改、细化和最终交付。

统一模型的价值也正是在这里体现出来。

SenseNova U1.5 Lite最终交付出去的依然只有8B。它没有不断叠加外部路由,也没有把不同任务拆给多个模型分别完成,而是先通过多个专项Expert补强能力,再把这些能力重新收进一个统一模型里。这样做的好处很直接:调用链路更短,部署更轻,同时还能尽量保住不同任务之间的一致性。

落到开发者和创作者的实际使用里,最终对应的其实就是三个字,快、好、省。

商汤的判断是,多模态仍然会是AI走向物理世界、真正进入生产环节的重要方向。因此这次U1.5 Lite正式版继续把大量精力放在稳定性、指令遵循和编辑精度上。它们未必像某个新玩法一样第一眼就很抓人,却更直接决定了模型能不能被真正用起来。

如果说三周前的Preview版本更多是在验证,一个8B统一模型的视觉能力究竟能铺到多宽。

那么到了正式版,问题已经开始变成另一件事:

这些已经铺开的能力,究竟能不能稳定地拿来干活。

GitHub:
https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:
https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova Studio在线体验:
https://unify.light-ai.top/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
绍兴7个葫芦,摘下没几天又挂回来了!“葫芦爷爷”回应:人家大老远跑来,看不到葫芦,我们心里也过意不去,说实话摘下来是不情愿的

绍兴7个葫芦,摘下没几天又挂回来了!“葫芦爷爷”回应:人家大老远跑来,看不到葫芦,我们心里也过意不去,说实话摘下来是不情愿的

台州交通广播
2026-09-11 23:57:26
3000亿一冻,美国彻底怂了!踢出美元体系这狠话,为啥不敢再提?

3000亿一冻,美国彻底怂了!踢出美元体系这狠话,为啥不敢再提?

趣味萌宠的日常
2026-09-12 02:58:29
上手iPhone Duo后我改主意了:折叠屏为何必须做到这么好?

上手iPhone Duo后我改主意了:折叠屏为何必须做到这么好?

报错免疫体
2026-09-11 00:30:16
OpenAI首席财务官弗莱尔最新访谈:一年前买入的算力设备,如今可以3-5倍价格卖出!

OpenAI首席财务官弗莱尔最新访谈:一年前买入的算力设备,如今可以3-5倍价格卖出!

投资者内参
2026-09-11 18:12:23
敲定日程!泽连斯基:9,月底乌美俄三方纽约会面,我信仰和平

敲定日程!泽连斯基:9,月底乌美俄三方纽约会面,我信仰和平

你是我心中最美星空
2026-09-12 13:32:43
百亿资金灰飞烟灭!把公司108个美女当作后宫,丁宁到底有多狠?

百亿资金灰飞烟灭!把公司108个美女当作后宫,丁宁到底有多狠?

潋滟晴方DAY
2026-09-02 15:24:52
68 岁大爷糖尿病恶化去世,从不饮酒!提醒:只因早上爱做 3 件事!

68 岁大爷糖尿病恶化去世,从不饮酒!提醒:只因早上爱做 3 件事!

叙说医疗健康
2026-09-12 06:00:17
五站全胜的18岁严子怡,为何让标枪教父送枪前先找教练?

五站全胜的18岁严子怡,为何让标枪教父送枪前先找教练?

愿你余生安好嘴角带笑
2026-09-12 12:04:03
上厕所时,大便前头干硬,后头软黏,说明什么?看完涨知识了

上厕所时,大便前头干硬,后头软黏,说明什么?看完涨知识了

芹姐说生活
2026-09-03 23:27:20
普京和越南一致同意,借道中国打通南北?借道中国铁路要大干一场

普京和越南一致同意,借道中国打通南北?借道中国铁路要大干一场

闻识
2026-09-12 02:03:20
人活多久,看起夜就知道?寿命短的人,起夜一般有这3个特征

人活多久,看起夜就知道?寿命短的人,起夜一般有这3个特征

芹姐说生活
2026-09-10 23:50:29
毛主席雕塑翘着二郎腿,被认为不雅观,华国锋:恰好显得和蔼可亲

毛主席雕塑翘着二郎腿,被认为不雅观,华国锋:恰好显得和蔼可亲

谈古论今历史有道
2026-08-21 08:50:05
詹妮弗·劳伦斯开Instagram,画风完全失控

詹妮弗·劳伦斯开Instagram,画风完全失控

影视情报室
2026-09-12 00:42:26
广西女子洪水中被毒蛇咬伤身亡,蛇场只愿给2万元补偿,因无法证明毒蛇来源,警方未立案,家属欲起诉!律师:非法养殖不能因洪水免责

广西女子洪水中被毒蛇咬伤身亡,蛇场只愿给2万元补偿,因无法证明毒蛇来源,警方未立案,家属欲起诉!律师:非法养殖不能因洪水免责

都市快报橙柿互动
2026-09-12 09:05:28
斯诺克疯狂一夜!逆转绝杀,4强诞生,世界冠军惨败,中国仅剩1人

斯诺克疯狂一夜!逆转绝杀,4强诞生,世界冠军惨败,中国仅剩1人

南海浪花
2026-09-12 03:16:00
AI将摧毁民主,统治者将转向控制、镇压而非分享权力

AI将摧毁民主,统治者将转向控制、镇压而非分享权力

修明札记
2026-09-09 13:46:04
改革开放后三大耻辱,每一件都是民族伤疤

改革开放后三大耻辱,每一件都是民族伤疤

回京历史梦
2026-09-12 09:24:59
河南一男子享受“皇帝”待遇,养几十个女人,还说有钱就要这样干

河南一男子享受“皇帝”待遇,养几十个女人,还说有钱就要这样干

江山挥笔
2026-03-15 18:13:59
头一回对护眼冷知识肃然起敬,网友:码住了!

头一回对护眼冷知识肃然起敬,网友:码住了!

另子维爱读史
2026-09-09 20:40:03
张雪公开致歉:由于个人管理能力不足,修养不足,让大家失望了

张雪公开致歉:由于个人管理能力不足,修养不足,让大家失望了

毒sir财经
2026-09-09 18:32:42
2026-09-12 16:04:49
量子位 incentive-icons
量子位
追踪人工智能动态
13298文章数 176559关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

哈里夫妇返回英国 不满被国王信函定义为"普通公民"

头条要闻

哈里夫妇返回英国 不满被国王信函定义为"普通公民"

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

本地
旅游
教育
房产
艺术

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

旅游要闻

呼和浩特:工业文旅赋能“世界乳都”建设

教育要闻

初中有零花钱和没零花钱的孩子,20年后差在哪?

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

艺术要闻

211米!义乌第二高楼,封顶了

无障碍浏览 进入关怀版