网易首页 > 网易号 > 正文 申请入驻

实测Macaron V1,还真给我GLM5.2调成0.8个Fable5了

0
分享至

完胜了,超越了,逼近了,

每次有新模型发布,介绍基本都长一个样。

推理更强了,代码更稳了,上下文更长了,Agent更聪明了。

榜单一排,柱状图一拉,每一项都比上一代强20%。所以我现在看模型,已经越来越不关心它在某张榜单上高了几分,不涨也不会放出来。

我更关心一件事,

稳定。

哪怕不是个全能水桶模型,只要能在我高频使用场景上一直有效,我很乐意冲个plan,很多时候这比我去openrouter扣扣搜搜挑一个免费模型要好得多得多。

还有67小时后Kimi额度才重置,Fable5用着API的我刷X看到了一个新模型Macaron V1,这也是我第一次看到公开的GLM5.2后训练模型,能一句话直出鹈鹕游戏,主打一个前端能力拉满,还把上下文扩展到了原生2M。

macaron. im/mindlab/research/introducing-macaron-v1

接入到Claude Code,加上taste skill之后一把出来的效果也挺能证明这模型UI水平的。待会我发发这个离谱的提示语,专门来测模型UI创意力的。


Macaron V1这次提出了一个新框架,MoL,

说穿了做了一件事,把基座模型整个冻住,一个参数都不动。所有后训练全发生在 LoRA 空间里。用人话说,就是同一个公司共用一套知识库,但客服,项目经理,程序员和设计师,各自保留一颗专业脑袋。

MoL想做的,就是让相近的任务互相强化,差得太远的任务各练各的。

像聊天需要理解你的语气,记住上下文,还要知道什么时候承认自己错了。

Agent要拆任务,调工具,处理意外,原来的路走不通了还得自己拐弯。

Coding更死板一点,语法,依赖,测试,终端,一个地方出错整段代码都跑不通。

UI又是另一种脑回路,视觉得好看,交互得能用,代码还不能只负责把首屏糊出来。

以前这些能力都挤在同一组后训练参数里,很容易优化跷跷板,代码提升来了情商就低了,情商上来了写作就都是幻觉了,所以我至今还怀念GPT5.4。

Macaron团队甚至专门做了一个插件来给UI打分,也就是测试AI模型的A2UI(Agent-to-User Interface) 能力,测的就是模型在对话中,除了回复文字外,能不能在合适的地方生成UI组件。





对于不爱用CLI命令行页面的人,马卡龙也一个Skill,也把问题解决了。

也就是说我可以直接看到之前的内容还不用/resume的一次次的开新视窗。相当于一个不用下载可装可关的Desktop App了已经。

github. com/mindverse-ltd/macaron-artifacts

纸面实力和新插件都看差不多了,是时候上真实任务了。

Kimi K3和Macaron V1都说自己UI好UI妙,那我就好奇了,在同样的任务下的表现会是怎么样。所以我给了一段精简提示词,

让V1来个自我介绍,没有额外提供技术栈限制,也没有让skill做场外辅助。

创建一个名为 web_design 的文件夹,并制作一个介绍 Macaron-V1-Venti 模型的交互式网页。
确保该网站达到生产级质量标准,并可直接部署上线。

总共花了十分钟左右,从0开始,一个没啥AI味带模块化设计还有可视化图表的介绍站出现了。


总的来说,里面带的特效,没有压过文字要表达的信息,还嵌入了加入Agent后的聊天UI对话,这是我在其他模型用一样的提示语还没见过的效果,还挺新颖的。


也是借由Agent聊天框的想法,让我萌生了实测个Agent聊天室吧的想法。

一样是短短的几句Prompt

创建一个名为 chat 的新文件夹,并在网页中展示一个多智能体聊天室。
确保各个智能体能够相互交流,同时我可以随时终止它们的对话。
整体氛围可以像一个“AI 议会”,围绕人工智能的未来展开讨论。

再等个十几分钟,它又又又出了结果


不同Agent各司其职,

有统筹者,有研究员,教育家和工程师也都进入了这个对话

让他们开始聊天后,消息源源不绝

大家都符合自己人设的疯狂表达。

在每轮对话主题过后还都有总结以及意向在边上让我做参考


从平时自己在家里跟Fable5斗智斗勇到现在看着Agent们内部间辩论的战火朝天,

这也就是三行提示词出来的效果。。。

再来再来,身为大模型,会点物理不过分吧,那让V1来做一个物理课教学页面,再考考模型的世界知识。

创建一个名为 gravity 的文件夹,并制作一个名为 Gravity Particle Lab(引力粒子实验室) 的精致单页 HTML 交互体验。
仅使用 HTML、CSS 和原生 JavaScript。所有代码都放在同一个 index.html 文件中,不使用任何外部库或框架。

## 核心概念
在一个大型交互式画布中展示动态粒子系统。画布中设有一个可以移动的引力源,用于吸引或排斥粒子。整体体验应更像一个轻量级的交互式物理实验室,而不是单纯的装饰性背景动画。

## 主要交互
在画布中渲染 100~300 个持续运动的粒子。
在画布中心附近放置一个引力源。
用户可以通过鼠标或触控拖动引力源。
粒子会加速朝引力源移动。
添加可选的排斥模式,将粒子推离引力源。
粒子碰到画布边界时应产生柔和的反弹效果。
限制粒子的最大速度,确保模拟过程保持稳定。
防止粒子被困在引力源内部。
保持动画流畅,并确保运动具有足够的稳定性和可预测性,避免出现失控或不稳定的情况。

从运动轨迹到不同参数导致的反应,都展现的稳定还正确。

因为是大项目的缘故,在没有调用任何Skill的情况下,V1还能在接受后还自己加上了个内测。


而为了继续测它的 Coding 能力,我又想到了一个看着简单,实际上特别容易出Bug的经典大一作业噩梦:2048。

这个游戏大家应该都玩过,页面本身并不复杂,

无非就是一个 4×4 的格子,几个数字方块,再加上滑动和合并动画。

但真要把它写对,里面的坑一点都不少。

比如连续四个2应该合成两个4,而不是直接变成8,

同一个方块在一轮移动中只能合并一次,

无效移动不能生成新方块,

好多好多都是之前其他Agent踩过的坑。所以它表面上是个小游戏,实际上更像是一场状态管理和边界条件考试。我给它的提示语还是很直接:

创建一个名为 2048 的新文件夹,并制作一款功能完整且可以正常游玩的 2048 游戏。
使用自适应的4×4棋盘,并正确实现原版 2048 的全部游戏规则。
支持方向键、WASD 键以及移动端滑动手势。加入流畅的方块移动与合并动画,并提供当前分数、持久化保存的最高分、重新开始、获胜、游戏结束和继续游戏等状态。
需要特别注意方块的合并顺序,防止同一回合重复合并,同时正确处理无效移动、重复输入和响应式适配。
确保所有交互均可正常使用,最终完成的游戏中不得包含占位控件或明显错误。

等它一次性生成结束后,整个游戏已经可以直接玩了。

从键盘操作,到数字方块移动和合并的反馈都做得很完整。

分数,最高纪录,重新开始,胜利提示和游戏结束状态也都有对应处理。

最后的最后,我一个真正的魔王任务来了。

这一次,直接把我们一直在做的AI学习网站,LearnPrompt交给它,现在重构之后长这样,


让它把原本偏内容型的学习页面,重新做成一个具有3D特效,可交互,还能清楚解释课程体系的展示网站。同时,我也允许它根据需要自行调用合适的 Skills。接到任务之后,V1没有说直接套一个常见的科技网站模板,是先读取了现有内容和项目规则,随后主动选择了Taste Skill,把它作为视觉与交互设计上的参考规范。

最终生成的结果,就是刚刚我发的第一个case,提示语也就是,

说实话,整体完成度比我预期中高不少,莫名有种我学习之前还可以看一个过场动画的感觉。

它使用了大量展开,收缩,切换和空间层级变化,把原本比较平面的学习内容重新组织成可以探索的页面。

不同内容之间不是简单地一段接一段往下堆,是通过交互和动画逐步呈现,让我在查看页面时有一种进入课程地图、逐层了解内容的过度感。



OK啊,就测到这儿,

聊点技术的,Macaron V1的2M上下文是怎么做到的,直接让glm5.2上下文翻了一倍。

他们发了个叫LongStraw的训练方法。现在强化学习训练有个硬墙,大概卡在256Ktoken。

模型学习的时候要同时记住刚才算了什么,反复比较好几个答案哪个更好,再把经验攒起来一起更新。

这三件事同时干的话,上下文再长一点显卡内存根本扛不住。

LongStraw的核心想法其实挺直觉的,一道题的题目大家都一样对吧,那题目只读一次,存个快照,后面只重播做题的过程。省下来的内存全拿去撑更长的上下文。实际效果上8 张H20上就把27B模型训到了 2.1M token,32 张H20上,GLM-5.2这种78层256路MoE的满血大模型也跑通了2.1M。

还有一个点我觉得有意思但容易被忽略的,他们的训练框架 MindForge 把上线后用的整套 Agent 环境原封不动搬进了训练。路由怎么分发、工具怎么调用、内存怎么排,训练和上线完全一样。

这也解决了一个老问题,训练环境和真实环境不一样导致模型上线就拉胯。

再说个更骚的,他们搞了个递归自我改进的闭环。模型自己出题,自己做,做完审计轨迹,改进harness配置,再拿优化后的数据更新自己。更新完的模型又能出更难的题。这个循环能一直转下去。

左脚踩右脚起飞了属于是。

从benchmark上看,Venti在大部分赛道上跟Opus 4.8、GPT5.5、Gemini 3.1 Pro打得有来有回,同时还是开放权重可以自己部署的。而且他们部署的GLM-5.2推理速度比智谱还快,这个我自己体感也对得上。


问题是现在按 API 调用收费,跑多了钱包扛不住。

我直接在线催更,

Mint Coding Plan 什么时候出?

出了我就是一个订订订。

@ 作者 / 卡尔 & yc星辰

最后,感谢你看到这里如果喜欢这篇文章,不妨顺手给我们点赞|在看|转发|评论

如果想要第一时间收到推送,不妨给我个星标

如果你有更有趣的玩法,欢迎在评论区聊聊

更多的内容正在不断填坑中……


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
他俩官宣结婚了!

他俩官宣结婚了!

奋斗在韩国
2026-09-08 10:11:26
四年级男孩周末独自在家上吊身亡,父母索赔70万被法院驳回:这次,网友吵翻了

四年级男孩周末独自在家上吊身亡,父母索赔70万被法院驳回:这次,网友吵翻了

教师吧
2026-09-07 17:17:34
针对印度裔的仇恨言论集中爆发,新加坡高层紧急灭火!

针对印度裔的仇恨言论集中爆发,新加坡高层紧急灭火!

补壹刀
2026-09-08 19:48:41
美媒:中国台湾地区首批新型F-16V战斗机在交付途中突然返航,原因成谜

美媒:中国台湾地区首批新型F-16V战斗机在交付途中突然返航,原因成谜

零度Military
2026-09-08 18:53:57
女子自称“遭4岁男童摸臀”,3次调解未果,律师:如果女子制止方式明显超过必要限度,需承担相应责任

女子自称“遭4岁男童摸臀”,3次调解未果,律师:如果女子制止方式明显超过必要限度,需承担相应责任

极目新闻
2026-09-08 20:06:32
人民日报这段话刷屏:请告诉你的孩子,人生这条路上,不会有人一直催着你、管着你、叫你起床、看你写作业……

人民日报这段话刷屏:请告诉你的孩子,人生这条路上,不会有人一直催着你、管着你、叫你起床、看你写作业……

阿呆爸
2026-09-08 22:24:52
天津一小学,拟注销!

天津一小学,拟注销!

天津生活通
2026-09-09 10:07:41
嚣张跋扈尝到苦果了!一家三口被遣返,上海飞洛杉矶飞机上打人事件结局舒适,评论区炸锅

嚣张跋扈尝到苦果了!一家三口被遣返,上海飞洛杉矶飞机上打人事件结局舒适,评论区炸锅

火山詩话
2026-09-08 10:33:51
实地探访“梅姨”落网地:在广州城中村被抓,出租屋不足10平米、月租金550元

实地探访“梅姨”落网地:在广州城中村被抓,出租屋不足10平米、月租金550元

封面新闻
2026-09-09 09:57:08
张兰暴瘦的照片刷屏了,我想说点不一样的

张兰暴瘦的照片刷屏了,我想说点不一样的

东方不败然多多
2026-09-09 05:45:14
车评人一句“腰疼鼻炎”赔了10万,账号还被封

车评人一句“腰疼鼻炎”赔了10万,账号还被封

闪存猎手
2026-09-08 20:51:57
这次,印加坡没来得及诬陷中国

这次,印加坡没来得及诬陷中国

韬闻
2026-09-08 22:45:06
回溯刘嘉玲 90 年被绑旧闻,不雅照轰动全港,当晚究竟经历了什么

回溯刘嘉玲 90 年被绑旧闻,不雅照轰动全港,当晚究竟经历了什么

搞笑娱乐笑话
2026-09-08 13:54:55
9月9日,人社部与财政部正式出炉关于2026年调整退休人员基本养老金的通知文件了吗?

9月9日,人社部与财政部正式出炉关于2026年调整退休人员基本养老金的通知文件了吗?

扶苏聊历史
2026-09-09 11:31:20
张雪峰看景甜那一眼,我足足回拉了七次进度条, 结局早就被写好了

张雪峰看景甜那一眼,我足足回拉了七次进度条, 结局早就被写好了

八卦王者
2026-09-07 15:55:22
西安大雁塔向雨水井投可疑物女子已找到,发现像采血管的透明收纳管:管内未见血迹,有多根缝衣针,样本已送检,事发原因正在调查

西安大雁塔向雨水井投可疑物女子已找到,发现像采血管的透明收纳管:管内未见血迹,有多根缝衣针,样本已送检,事发原因正在调查

三湘都市报
2026-09-09 10:23:35
胆子太大!上海地铁里几乎绝迹,有前科男子看到此景心生贪念……警方:刑拘!

胆子太大!上海地铁里几乎绝迹,有前科男子看到此景心生贪念……警方:刑拘!

上观新闻
2026-09-08 15:06:48
6-3,6-2,郑钦文横扫昔日克星,终结三连败+复仇8年之耻,下轮对手更强

6-3,6-2,郑钦文横扫昔日克星,终结三连败+复仇8年之耻,下轮对手更强

主宰稳场
2026-08-25 09:21:40
小卡参加猛龙训练营!交易未官宣真因曝光:快船需产生新任决策者

小卡参加猛龙训练营!交易未官宣真因曝光:快船需产生新任决策者

罗说NBA
2026-09-09 05:17:58
利曼大捷!俄罗斯空天军的黑色星期一,总计损失5架战机

利曼大捷!俄罗斯空天军的黑色星期一,总计损失5架战机

鹰眼Defence
2026-09-08 17:14:23
2026-09-09 12:11:00
卡尔的AI沃茨 incentive-icons
卡尔的AI沃茨
前大厂算法工程师,3家科技公司技术总监|致力打造最系统的Al学习体系,让1万人通过Al提高生产力
330文章数 146关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

夫妻俩花12万做龙凤胎被安排去异地移植 检测只怀单胎

头条要闻

夫妻俩花12万做龙凤胎被安排去异地移植 检测只怀单胎

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭麒麟最便宜贵公子争议,本人未回应

财经要闻

8月CPI同比涨0.8% PPI环比由降转涨

汽车要闻

坦克700申报信息曝光 长轴距版轴距增150mm/首搭6座

态度原创

本地
旅游
家居
手机
公开课

本地新闻

宁波,中国制造的隐藏大佬

旅游要闻

陕西渭南:“群星”耀蒲城

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

苹果iPhone Ultra或定价2199美元 国行1万5起

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版