返回全部文章
GuidePicoBerry Team

文本生成 3D 还是图像生成 3D?实际做起来两条路都会走

问题不在于选文本还是选图像,而在于趁改动还容易的时候,把决定放在哪一步做完。剪影、角度和风格都是在还是平面的时候定下来的,所以多数工作流会先写提示词、再生成图像,然后把图像转成 3D。

两个入口摆在面前,看上去很像一个岔路口:是从提示词开始,还是从图像开始。文本生成 3D图像生成 3D 各自都有专门的工作流页面,单独拿出来也完全说得通。但只要在旁边看着别人用道具把一个场景填满,你会发现同样的顺序反复出现:先写一段提示词,用它生成一张图像,再把那张图像转成 3D。这两条路并不是互相替代的关系。通常是其中一条在给另一条供料,而弄清楚原因之后,你也就知道什么时候可以省掉某一步。

原始参考图与由它生成的 3D 模型并排对比

应该从文本开始,还是从图像开始?

**如果你手上已经有一张值得作为起点的图,就从图像开始。**比如概念图、草稿或者参考照片。这张图里已经包含了关于比例、风格和剪影的判断,再用文字把它重新描述一遍,只会把已经握在手里的信息白白丢掉。

如果没有,就先写提示词、先生成一张图像,然后再转换这张图像。从文本直接走向网格,在你要的是广度而不是精度时更快——比如为一个还没设计定型的东西铺开十几个粗略方向。但如果你瞄准的是某个具体结果,中间这一步就完全值回票价,因为剪影、角度和风格都是在还是平面的阶段定下来的。那里是还能推倒重来的最后一个位置

两条路径各自擅长什么?

它们不是同一类工具。

  • **文本生成 3D 是看广度的工具。**一条提示词出多个候选,在任何人投入建模时间之前先横向摆开比较。你不是要命中靶心,而是要看清都有哪些选项。
  • **图像生成 3D 是求精度的工具。**输入端已经带着判断,于是工作从"创作"变成了"解读"。

用同一条提示词多次生成的结果并排比较的界面

这个差别会直接体现在你怎么评估结果上。走文本生成 3D,你是在几个方向之间互相比较;走图像生成 3D,你是拿结果去对照一张早就达成共识的参考图。

为什么值得多走一步图像?

因为提示词改起来只要几秒,网格却不是。

改一句话、重新生成一次——在文本阶段改主意的成本也就是这么多。可一旦几何体已经存在,想调整比例或姿态,就意味着要么从头再生成一次,要么真的动手建模。所以做决定最好的地方,就是还来得及回头的最后一个节点,而那个节点就是图像。

这里也是最常见的问题被拦下来的地方。一段读起来很漂亮的提示词,照样可能产出一个拉远就糊成一团的剪影,或者一个撑不过绑定的姿态。看图,几秒钟就能发现;等看到模型才发现,那就晚得多,代价也大得多。

PicoBerry 的两个工作流页面是从相反的两侧讲这件事的。文本生成 3D 那一页把真正有用的问题定为:**这个结果能不能帮团队决定留下什么、打磨什么、舍弃什么。**图像生成 3D 那一页则指出,即使是一张清晰的概念图,作为 3D 规格依然是不完整的——厚度、背面结构、关节、尺度、材质分区都还藏着。把两边叠起来,结论只有一个:把图像做扎实,同时仍然做好要审模型的准备。

转换之前,怎么判断一张图像?

不是看"好不好看"。图像是 3D 环节将要读取的规格,所以要用那个环节的眼光去看。

检查项要看什么
剪影缩到缩略图大小看一眼。如果认不出这是什么东西,模型不会替你把它补回来
完整性物体是否完整可见?被裁掉的边缘和严重遮挡,到了 3D 里就变成猜测
姿态中性优于戏剧化。富有表现力的角度在平面上好看,到了网格里却处处掣肘
风格定调风格化参考和写实参考产出的几何体不一样——要在之前定,而不是之后
背景分离主体能不能和它背后的东西区分开?

这些问题在提示词一侧修正,代价是多生成一次;等模型出来以后再修,代价是搭进去半天。

什么时候一张图像不够用?

单一视角描述不了背面。如果你有同一物体的多个角度,把它们一起喂进去,正好能化解那种让单图结果显得"空心"的歧义——深度、被遮住的结构,以及镜头从未拍到的部分。

把同一物体的多个参考视角一起作为 3D 生成输入

正反面差异越明显的对象,这一点越关键:角色、载具、立面精细的建筑。对于对称的小道具就没那么重要,一个好角度通常就带够了信息。

什么时候可以完全跳过图像?

直接走文本生成 3D 是合理的,前提是描述本身就等于规格。"木箱、边角磨损、游戏道具"中间并不需要一张图,加进去只是多一道工序。

另外两种情况也一样。一是在做那种外观并不特别讲究的填充几何体时;二是在项目早期,你想看到的是十几个方向而不是一个正确答案,此时目的本来就是看清幅度。

什么时候可以跳过文本?

直接走图像生成 3D 的理所当然的场合,是图像已经存在、而且这张图是说了算的:美术给的概念图、你自己画的草稿、实物拍的照片。再用一段文字把它重新生成一遍,只会丢掉你本来就有的信息。

把道具概念图转换成 3D 模型的结果

对已经确立了美术方向的团队来说,这也是更诚实的答案。既然概念美术已经把决定做完了,生成这一步就应该尊重这些决定,而不是重新解读一遍。

哪些部分仍然需要人工?

两条路都不会交给你一个成品资产,这一点还是直说为好。

不管出来的是什么,都还要过一遍审查:拓扑、尺度、材质分区,以及它在原本要用的那个场景里到底立不立得住。有些结果会被重做,有些会被砍掉。这个循环本身就是工作,换哪个入口都消不掉它。

把生成的资产放进场景,并用建模工具继续打磨

这两条路真正改变的,是你能用多小的代价抵达一个值得审视的东西。这个说法比"AI 帮你做好资产"要小得多,但它是能在真实项目里活下来的那一个。

不同团队该怎么套用?

  • 独立开发者 — 文本 → 图像 → 3D 这条路通常值得多走那一步,因为美术方向是你定,模型返工也是你自己来。
  • 有概念美术的团队 — 从他们的图开始。判断已经做完了,用文本重新生成一遍等于把它扔掉。
  • 需要快速填满场景的人 — 背景和填充物直接走文本生成 3D,把图像这一步留给玩家真正会盯着看的物体。
  • 做工具的开发者 — 两条路都可以通过 PicoBerry API 调用,所以同一套判断可以写进代码:生成图像,用程序检查,再做转换。

延伸阅读

一句话总结

这不是文本还是图像的问题,而是趁改动还容易时把决定放在哪一步做完的问题。手上有值得当起点的图,就从图像开始;没有,就写好提示词、先生成一张图像。无论走哪条路,模型都只是以候选的身份交到你手上,而那一遍审查依然是你的活。

继续阅读