![]()
从今年 4 月开始,Mac mini 就逐渐成为「AI PC」的代名词。
![]()
Mac mini 除了被个人消费者疯抢,在企业市场同样供不应求,就连 OpenAI 都要买上数万台 Mac mini 和 Mac Studio 来进行模型的训练,Anthropic 也在亚马逊 AWS 上租赁大量的 Mac 服务器。
![]()
AI PC 的竞争,也开始从「能不能跑模型」,转向「能不能长期让 Agent 在这台电脑上工作」。
LM Studio Bionic、设备端模型、AI 智能体、exo 集群都成了 Mac mini 的主打。苹果甚至直接把新 Mac mini 描述为一台可以「全天候」运行智能体的桌面电脑。
![]()
6999 元起,16+256 的 M6 芯片,一台最低配的 Mac mini 到手,你会拿它做点什么。
APPSO 也拿到了一台 M5 Pro 的 48GB + 2T 的新 Mac mini,这台 Mac mini到手需要 25749 元,或者免息分期 24 个月,每个月 1073 元。
![]()
说实话,这一点都不 Mini。
但如果看这一年的 PC 市场,几乎所有主打 AI PC 的电脑,都在讲统一内存,都在讲算力,Windows 那边有 AMD 和英伟达,开始把一些高性能的算力芯片下放到笔记本电脑上,而不是一味地在追求 5090 显卡等。
![]()
对比同参数级别的电脑体积,又会觉得这个放在桌子上,小小的,几乎是不占据太多地方的小盒子,是真的很 Mini。
运行专业软件当然还是高性能 Mac 最擅长的事情,但现在 AI 开始成为调用这些能力的新入口。
写代码不再只是打开 Xcode 自己敲;处理几十份资料,也不一定需要一个个打开文件;Blender、剪辑软件、终端和本地模型,都可能变成 Agent 完成一个任务时调用的工具。
![]()
而与 AI 更直接相关的,还有视频剪辑软件里 AI 的画质提升、照片和视频中的 AI 增强;以及我们都想通过一台电脑,就打造的个人智能终端。
我们手里这台 25000 元多的 Mac mini,大概率不会是普通消费者的选择。搭载 M6 芯片,16GB+256GB 的版本可能才是大多数人会入手的 Mac mini。
更高的配置可以让 Mac mini 拥有本地部署大模型的能力,但即便不拿它部署大模型,一台 6999 的 Mac mini 也会是当下适合给 Agent 使用的电脑,因为它很好地为 AI 提供了一个可以持续工作的地方。
![]()
就像 APPSO 之前说的,新 Mac mini 是一台为 AI 造的电脑,那我们这次重点看看它是否更好地为 AI 提供了一个持续工作的地方。
能装下 270 亿参数的 AI
M6 看起来拥有这一代最完整的 AI 配置:12 核 GPU 的每一个核心都有 Neural Accelerator,同时还有双 16 核 Neural Engine。根据官方的对比显示,相比 M4 Mac mini,M6 Mac mini 的 AI 性能最高提升 4 倍。
但如果我们真的想要在电脑上运行大模型,另外两个经常被提起的数字可能更加重要:内存容量和内存带宽。
M6 Mac mini 最高只有 32GB 统一内存,带宽最高 170GB/s;M5 Pro 则可以来到 64GB 和 307GB/s。
![]()
随着开源模型的能力逐步逼近 Fable 5、GPT-5.6 Sol 这类顶尖模型,开源实验室也开始推出从 10 亿参数到超过 700 亿参数的大模型,本地化 AI 变成 AI PC 的主打。
我们准备了几个不同体量的量化模型,从大约 8B、14B,一路增加到 30B 级别,再继续挑战接近机器内存极限的模型。
每个模型都执行同一组任务:给它一份长度固定的资料,要求阅读、总结、回答问题,再进行几轮连续追问。
记录模型载入时间、Time to First Token、Prompt Processing、Generation Speed,以及整个过程中占用了多少统一内存。
![]()
一开始先是用了 GPT 的 20B 开源模型,然后问一下它是什么模型,这一轮对话就处理了 72 个输入 Token,生成了 178 个输出 Token,整轮请求耗时约 3.64 秒,平均生成速度为 55.66 Token/秒。
继续测试千问的 Qwen3.8 27B 参数,量化到 4 比特的模型,能看到回复的速度还是很快,总用时 2.9s,生成的速度是 41.64 token/s。
![]()
当输入一份超长的文档时,我们发了 Attention is all you need 那篇论文给它,可以看到最终的处理速度也有 32 token/s,对于一个 27B 的本地大模型来说,Mac mini 的速度基本上是可以接受的。
![]()
![]()
再往上,更大的模型,是 Meta 最新的开放模型,300 亿参数,专为始终在线的本地智能体打造。同样的论文总结任务,能看到随着模型参数变多,Mac mini 的读入速度和生成速度都有变化,尤其是读入的速度从 473 token/s 降到了 只有 32 token/s。
![]()
而当面对 70B 的 Llama 3.1 模型时,虽然也能跑,但我们只是发了一句你好,总用时 2 分钟 48 秒,平均生成速度是 0.05 Token/s。
![]()
对本地大模型来说,除了不同参数量和量化的区别,针对 Mac 还有 GGUF 和 MLX 两种路线。
比如,同一个 Qwen 模型可以分别制作成 GGUF 版本和 MLX 版本。它们可以来自同一个模型,区别在于如何保存参数、如何量化,以及用什么引擎运行。
![]()
GGUF 是模型文件格式,MLX 是苹果开发的机器学习框架。GGUF 路线的主要特点是支持多种硬件,跨平台使用方便,而 MLX 则是围绕 Apple Silicon 设计,利用统一内存架构。
![]()
图|mlx-framework.org
不过,虽然MLX 围绕苹果芯片设计,但具体哪个更快、更省内存,要看模型和运行时版本。
总的来说,对于一个 48GB 运行内存的 M5 Pro Mac mini,舒适区就是 200 亿到 300 亿参数附近的大模型,也可以试试 330 亿参数的 MiniMax H3,用来做视频生成。
打造自己的智能体
2026 年的今天,一台「AI PC」的性能如果通过「能跑 AI来体现」,明显有些不够了。
LM Studio Bionic 就是其中一个很典型的例子。它并不是单纯再做一个本地模型客户端,而是让模型获得读取项目文件、运行命令、修改代码和连续执行多步任务的能力。
![]()
在 LM Studio Bionic 内,我们可以直接使用本地模型,也可以在处理较重任务时切换到云端的付费开源模型。
其实我们手上的电脑,到底能安装多大的大语言模型,在 LM Studio Bionic 内就能直接看到。
![]()
在应用内,我们可以直接勾选「仅包括在已知设备上可运行的精选模型」,它会主动识别到设备的可用内存,以及针对每个模型,会显示「Full GPU Offload Possible」或「Likely too large」等提醒。
![]()
![]()
接下来我们准备让 Mac mini 真正干活。给 Agent 一个装有二三十份资料的文件夹,其中包括 PDF、Markdown、表格和此前整理的研究资料,看看如此庞大的上下文,它还能不能处理好。
![]()
最近还有 Computer Use 比较火,我们也让它操作 Blender 做了一个 3D 模型。不过 LM Studio Bionic 没有使用 Computer Use 的方式,而是直接用的 Blender 内置 Python API 进行操作。
![]()
最后,也让它利用这个生成的 3D 模型,搭建了一个果味的营销网页。
![]()
而用于视频生成的 330 亿参数 MiniMax H3 模型,官方 HuggingFace 的文件是有 498G。
我们在 LM Studio Bionic 内找到了第三方经过压缩后的 MiniMax H3 模型,但 LM Studio 的内置推理引擎,主要支持语言模型及部分视觉理解模型。
![]()
继续使用专门的开源模型视频生成平台 ComfyUI,我们直接使用已有的 MiniMax H3 工作流。实测下来,视频生成的压力还是很大,Mac mini 瞬间变烫了不少,内部的风扇转动声音也更加明显。
![]()
最后的效果是,一个 15s 的视频,Mac mini 跑了将近 90 分钟之后才生成,而将时长切换到 5s,用时 18分钟就能得到一段视频。
![]()
所以如果只是把 Mac mini 当成本地大模型和 Agent 主机,它已经相当够用;但如果希望它同时承担大型视频生成、训练这类重型 AI 计算,它的定位很明显不是一个单纯的高性能 GPU 工作站。
一种新的电脑用法:Agent 服务器
对大多数人来说,在自己的电脑上跑一个尽可能大的模型,本身也并不是刚需。
这次体验下来,我们反而觉得更值得关注的是:当 Agent 开始真正接手写代码、整理文件、剪视频、做 3D 这些工作之后,我们使用电脑的方式也在发生变化。
过去电脑的性能几乎都服务于坐在它面前的人;现在,同一台电脑开始需要同时服务几个在后台工作的 Agent。
在性能和配置之外,这台 Mac mini 让我们感兴趣的地方,依旧来自它的形态和苹果生态,它没有电池,不需要带出门,体积又足够小,通过接力还能让我的 MacBook Air 当做它的键盘和触控板。
![]()
这让它天然就适合一件笔记本不太适合长期做的事:一直开着。
更高配的 M5 Pro 还拥有 Thunderbolt 5,可以连接多台 Mac mini 组成集群,在设备端运行大型 AI 模型。
于是,我们尝试把它作为一个 Codex 的 Agent 服务器,让那本原本 Mac mini 擅长的任务,现在以远程的方式,通过 Codex 来完成。
![]()
我们这台 Mac mini,其超大的内存和带宽,几乎在处理各种复杂的电脑任务时,都不会有卡顿的情况。
在没有 AI 之前,48GB 的统一内存非常适合用来做开发,尤其是用「一台机器处理一整套开发环境」。
例如使用苹果开发者的 Xcode 来编译大型工程,甚至是安卓开发的 Android Studio + iOS Simulator + Docker +IDE,再加上浏览器几十上百个标签页一起打开。
![]()
其次是创意生产的工作,比如使用 Final Cut Pro、DaVinci Resolve 达芬奇,剪辑 4K/6K/8K、多机位、ProRes RAW,叠很多特效、降噪、调色节点的视频。
再同时处理大型摄影/平面设计工作流,用 Lightroom 批量处理几千张 RAW,打开 Photoshop 做几十层甚至上百层的大尺寸 PSD/PSB。
还有 3D 制作、音乐创作等,几百轨工程、大型场景的多高分辨率贴图、粒子,都需要大量的统一内存。
而 M5 Pro 自带 H.264、HEVC、ProRes、ProRes RAW 的硬件编解码引擎、硬件光追等能力,几乎在这块市场是完胜。
![]()
虽然并非单个程序就需要 48GB,但现在我们可以让这一大堆的任务,全部让 AI 同时进行。
我们没有让 Codex 去操作 Xcode 做一个普通的 App,而是让它尽可能同时处理 Xcode 工程管理、SwiftUI、数据库、文件系统、多线程等等复杂的任务,要求它实现一个「原生 Apple 全家桶素材管理器。」
![]()
与此同时,我们还能在手机上下命令,「我电脑上的某个文件夹里有大约 100GB 的 4K 视频、照片和录音素材;请你帮我把它们整理并制作成一支 3~5 分钟的 4K 视频。你可以通过 Computer Use 使用电脑上的 Final Cut Pro 或者达芬奇进行处理。」
另一边,它又能继续处理「造一个大型 Blender 项目,再自己渲染。」我们只是在 Codex 里说了一句话,Mac mini 就能自己打开 Blender,建了一座城市,又把它渲染成了视频。
![]()
48GB 在这个大型 3D 项目下,要处理的大型 Geometry Nodes、纹理和 Cycles scene 等内容,就开始真正有意义。它需要给这些长期驻留、同时工作的 Agent 留出空间。
更好的情况是,当四个 AI Agent 都在替我干活,我们依然能正常使用这台电脑。
![]()
![]()
过去我们衡量一台电脑的多任务能力,看的是它能同时打开多少软件;浏览器、Photoshop、Xcode、剪辑软件一起在后台使用,电脑还能不能保持流畅。
但到了 Agent 时代,「多任务」正在变成另一件事。
一个 Codex Agent 在 Xcode 里写 App,一个在后台编译 Chromium 内核,一个处理 100GB 数据,另一个控制 Blender 建模和渲染。与此同时,轻量化的本地模型还可以常驻内存,等待随时调用。
Mac mini 作为 Agent 主机的「真正落地」,并不是说用它来运行某一个 Agent,就要消耗掉 48GB,更多地是未来一台电脑可能同时有四五个 Agent 在后台替我们工作,传统 PC 的「多任务」正在变成「多 Agent」。
![]()
Mac mini 这种不用带走、可以全天候运行、又拥有足够内存和算力的小盒子,可能是最早适应这种变化的 PC 形态之一。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.