Unity Sentis 是一个智能模型“播放器”,能让游戏直接在玩家的设备(PC、手机、主机等)上本地运行 AI 模型,并实时返回计算结果。这一能力自 Unity 2022 版本起被引入,团结引擎继承自该版本,因此也原生支持。为了帮助开发者更方便地使用该能力,Unity 中国资源商店已上架 200 多款模型。本文从中精选了五款进行介绍,它们均已适配团结引擎 Sentis 推理运行时,开箱即用,支持端侧 AI 推理。后面我们还会带来更多模型介绍,也欢迎大家前往 Unity 中国资源商店亲自体验和探索。
访问链接:
https://assetstore.u3d.cn/search?q=AI%20model
文本转语音模型:inference-engine-unity-inference-engine-jets-text-to-speech
Jets Text-to-Speech是一种高效、自然的文本转语音(TTS)生成模型 。该模型通过深度神经网络对输入文本进行分析和编码,进而合成出流畅、自然的人类语音。Jets TTS 集成于团结引擎推理引擎后,开发者可以实现虚拟角色台词实时合成、语音助手回答及无障碍阅读等功能,极大提升了交互的沉浸感和多模态体验。
模型优势
语音合成流畅自然,接近人声水平;
支持多种情感、腔调、性别的切换,赋予角色“灵魂”;
延迟极低,满足实时交互需求。
技术特点
支持多种语言与语音风格,声音拟真度高;
具备实时推理能力,适合交互式场景;
可与团结引擎场景无缝协作,输出标准语音文件或流式音频数据。
应用案例
游戏中的 NPC 台词自动生成与配音;
虚拟数字人的口语播报、AI 客服;
在线教育、朗读辅助、无障碍阅读产品。
模型链接:
https://assetstore.u3d.cn/packages/add-ons/machinelearning/assetstore-package-20005332
单目深度估计模型:inference-engine-unity-inference-engine-midas
MIDAS是一款优秀的单目深度估计模型,可以仅凭一张普通 RGB 图片预测出场景各像素点的相对深度。其原理基于卷积神经网络,通过对海量带标签的图片训练,学习像素特征与深度之间的关系。
模型优势
无需专用硬件,仅凭 RGB 相机即可获取深度场信息;
对各种光照、物体尺度具备天然适应性;
可与AR、VR 实时流媒体直接对接。
技术特点
单目输入即可快速获取稠密深度图,无需专用深度相机;
算法高效,支持实时处理,适合嵌入式与桌面端部署;
经过大规模数据训练,对真实世界或虚拟场景中的室内室外环境都能给出稳定且不错的深度预测。
应用案例
游戏/虚拟现实场景中的 3D 环境自动重建;
机器人/无人机的环境感知与路径规划;
安全驾驶辅助(视觉感知层)。
模型链接:
https://assetstore.u3d.cn/packages/add-ons/machinelearning/assetstore-package-20005333
轻量智能AI模型:inference-engine-unity-inference-engine-minilm-v6
MiniLM-v6属于轻量级的 Transformer 系列自然语言理解模型。它通过知识蒸馏将大模型中蕴含的语言理解与推理能力迁移到更小参数规模的网络结构上,在保证性能的同时极大减少了推理资源消耗。
模型优势
在保证高准确率的同时,明显降低了内存和算力需求;
支持文本分类、实体识别、语义检索等主流NLU任务;
启动和响应速度快,适用于移动设备与实时在线场景。
技术特点
模型小巧,部署高效,适合边缘端与实时应用;
在文本分类、摘要、问答、情感分析等任务上表现突出;
多语言支持,易于与团结引擎项目中的多文字内容处理结合。
应用案例
游戏对话系统、智能 NPC、任务提示;
智能客服、自动 FAQ 与内容审核;
云边协同文本理解与推荐系统。
模型链接:
https://assetstore.u3d.cn/packages/add-ons/machinelearning/assetstore-package-20005334
图像识别和分类模型:inference-engine-unity-inference-engine-mobilenet-v2
MobileNet-v2是一款专为移动端和嵌入式设备设计的轻量级图像分类模型。它采用深度可分离卷积和倒残差结构,相较传统 CNN 拥有更低的计算复杂度和更小的模型体积,却能在绝大多数图像识别任务上提供接近主流大型模型的准确率。
模型优势
支持目标分类、检测与分割等任务;
部署资源极低,可在手机、VR 头显或物联网设备运行;
与团结引擎集成无缝,可搭配摄像头实时推理。
技术特点
高效结构设计,适合低算力终端快速部署;
支持目标检测、图像分类等多类视觉任务;
与团结引擎深度整合,便于开发实时图像智能应用。
应用案例
视频流中的目标追踪与识别;
增强现实交互中的图像分割与物体标记;
安防监控、智能家居视觉入口。
模型链接:
https://assetstore.u3d.cn/packages/add-ons/machinelearning/assetstore-package-20005335
语音识别模型:inference-engine-unity-inference-engine-whisper-tiny
Whisper-tiny是基于 OpenAI Whisper 架构的轻量级端到端语音识别模型。该模型可将音频中的语音内容高速、高精度地转写为文本,并支持多语种识别。
模型优势
小体积、快推理,适合在线与边缘设备集成;
多语种能力涵盖广,可服务全球项目;
支持口语、对话、演讲等多种语音场景。
技术特点
端到端自动语音识别,不依赖外部规则或特征工程;
相比标准版 Whisper 参数量更小,推理速度更快,适合资源受限场景;
支持多语种跨域识别。
应用案例
游戏或交互 APP 中的实时语音输入和指令;
无障碍实时字幕、会议记录、语音搜索等;
VR/AR 中的语音交互与命令识别。
模型链接:
https://assetstore.u3d.cn/packages/add-ons/machinelearning/assetstore-package-20005338
除本文介绍的五款模型,Unity 中国资源商店已上架的 200 多款 AI 模型均经过充分测试,能够在团结引擎上顺畅运行,覆盖多种不同的 AI 能力,大家可以前往商店探索使用。
扫码查看AI大模型
Unity 官方微信
第一时间了解Unity引擎动向,学习进阶开发技能
每一个“点赞”、“在看”,都是我们前进的动力
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.