多语言支持现已支持中文和日语
AI 智能体 · Unity 关卡原型

AI 智能体能不能搭出 一整个游戏关卡?

通过 MCP 接入 Unity 编辑器的 Fable 5,用 PicoBerry API 把每个道具都生成出来,并按名称摆放;白模和手工收尾则交给 UModeler X。一个取材自 Dust II 的 A 点,从平面图到能走动的场景,约 8 小时完成。下面就按实际做下来的三个部分,拆开来讲。

查看制作过程

在 Unity 里以街道视角走过已完成的 A 点。

使用工具UnityUModeler XFable 5MCPPicoBerry API

AI 智能体能在 Unity 里搭出一个游戏关卡吗?

做原型可以。用 MCP 把 Unity 接到智能体后,Fable 5 先把白模层级整理成命名清晰的模块,再调用 PicoBerry API 逐个生成道具和建筑,并按名称摆放。它承担了重复的那一半,把摆放推进到大约 70%;剩下的 30%,也就是缩放、对齐、贴合和美术方向,在 UModeler X 里手工收尾。整个 A 点大约花了 8 小时。这是原型,不是竞技地图。

拆成三个部分的制作过程

哪些留给人做、哪些交给智能体,以及资产的处理方式发生了什么变化。

Part 1 — 白模仍由人来搭

A 点的体块、掩体和射线都在 UModeler X 里手工搭建。这是设计工作,正因为先做了它,最终场景才读得出是一张地图。(UModeler 团队正在开发把平面图转成白模的功能。)

在 Unity 内的 UModeler X 里手工搭建 A 点白模

Part 2 — 重复的活儿交给智能体

Fable 5 先把整个白模层级整理成命名清晰的模块,再从参考图用 PicoBerry API 生成全部道具,并按名称摆放。智能体处理了约 70%,剩下的 30% 手工收尾。一个场景所需的资产,大约两小时。

智能体用 API 生成道具并摆放到场景中

Part 3 — 资产是廉价的零件,不是成品

基础地形从 Unity 导出,风化交给 API,再用干净的 UV 展开让结果彼此贴合。装有九堆碎石的一张图变成九个预制体,用地形笔刷撒开,而不是一个个摆。这一道收尾用了三小时,总共八小时。

在收尾阶段做风化、地形图案和道具撒放

API 生成的东西

每一栋建筑和道具都从一张 2D 参考图开始,走 image-to-3D。地面不是建模出来的几何体,而是来自生成的平铺图案。

生成的破旧药店建筑 3D 模型

药店

生成的街角小店建筑 3D 模型

街角小店

生成的带圆顶石砌建筑 3D 模型

圆顶建筑

生成的带卫星天线建筑 3D 模型

卫星天线建筑

生成的碉堡棚屋 3D 模型

碉堡棚屋

生成的碎石堆 3D 模型

碎石堆

生成的木箱 3D 模型

木箱

生成的石阶 3D 模型

石阶

用于地形的沙漠泥土平铺贴图

地形 — 泥土

砂岩铺装的平铺贴图

地面 — 砂岩

开裂沥青的平铺贴图

地面 — 沥青

用作布局输入的 A 点俯视平面图

输入的平面图

前后对比

同一个场景的灰盒与成型。两者之间的差距,就是这套工作流做出来的东西。

未加入任何资产前 A 点的黏土渲染

白模 — 黏土

仅体块。

放入生成资产后 A 点的黏土渲染

成型 — 黏土

同一机位,摆放之后。

装饰前灰盒 A 点的游戏内画面

白模 — 游戏内

街道高度的灰盒。

装饰后 A 点的游戏内画面

成型 — 游戏内

同一视角,收尾之后。

实话实说的部分

智能体没能做的事。

只靠提示词只能得到灰盒

智能体只是操作编辑器,并不决定关卡该有什么感觉。体块、掩体和射线是先手工搭的,正是这个顺序,结果才勉强读得出是一张地图。

摆放是约 70%,不是 100%

物体摆错的情况够多,必须过一遍人工。缩放、贴合和对齐都在 UModeler X 里手工修正。

有些生成结果被舍弃

生成的网格被当作廉价零件,而不是成品美术。有几个重做或直接弃用。重做只花一次调用,所以才敢这么处理。

从头到尾的完整过程

白模、生成、摆放、细化,一气呵成。

一个 A 点,约 8 小时。

常见问题

这个关卡里 AI 实际做了多少?
摆放大约 70% 准确到位,层级命名和资产生成由智能体从头到尾完成。剩下的 30%,也就是修正、缩放与贴合、美术方向的取舍,在 UModeler X 里手工完成。
AI 智能体靠什么和 Unity 连接?
MCP。Unity 通过它接到智能体,于是 Fable 5 能在打开的场景里直接操作:读取层级、重命名对象、把生成的资产按名称摆放。
要用这套工作流,必须会建模吗?
你得能判断白模的好坏。体块和射线是手工搭的,因为那是设计工作;装饰则由智能体和 API 承担。
3D 资产从哪里来?
PicoBerry API。每个道具都从一张 2D 参考图开始,用 image-to-3D 转换;地面不是建模的几何体,而是来自生成的平铺图案。
每个阶段各花了多少时间?
白模是第一道;资产生成与摆放大约两小时,细化那一道约三小时,分几次会话,总共八小时。
这个结果能用在正式发行的游戏里吗?
把它当原型看。管线里出来的资产需要过一遍审查,有的重做,有的弃用;真正要发行的关卡,还需要超出这次范围的美术方向、优化和试玩测试。
这只适用于 Unity 吗?
智能体在编辑器里操作这一部分是 Unity,经由 UModeler X 和 MCP。生成这一侧则不是:PicoBerry API 返回标准的 GLB 和 FBX,所以同一套资产工作流也适配 Unreal、Godot、Blender 或网页运行时。

用编辑器里的智能体,为你的下一个关卡做原型

生成道具,让智能体去摆放,再由你自己在 Unity 里收尾。

获取 UModeler X