你现在看到的这些图片,都是我使用 ChatGPT 集成 DALL·E 3 模型生成制作的。ChatGPT 是去年11月发布,至今已接近一年时间。在本轮 AI 浪潮中,除了 ChatGPT 这类文本生成工具外,还有 MidJourney、Stable Diffusion 等图像生成模型。

这两类产品在商业和职场中已对许多设计师的工作产生显著影响。但对普通用户而言,其应用仍显冷淡,一个重要原因是:图像生成模型的使用门槛较高。你需要专门学习 Prompt 的语句结构,还需具备一定英文能力才能上手,远不如 ChatGPT 那样几乎零门槛即可开始对话与使用。

然而,OpenAI 最近发布的、集成 DALL·E 3 的 ChatGPT 模型改变了这一现状,大幅降低了文字生成图像的操作门槛。

本文将介绍:相比 MidJourney 和 Stable Diffusion,使用 DALL·E 3 进行文生图有哪些特点与优势;适用于哪些典型场景和任务;以及如何在不付费的情况下体验该模型。

首先,如果你要在 ChatGPT 中使用 DALL·E 3,需选择 GPT-4,并在模型选项中选择“DALL·E 3”(位于列表末尾)。与默认模型不同,DALL·E 3 当前不支持上传图片进行理解或编辑——即无法实现“图生图”,仅支持纯文本输入生成图像。

例如,我让 ChatGPT 帮我生成一张背包海报,初始提示信息非常简略。系统随即反馈需要更多细节,补充后生成了四个版本。接着我提出需求:“只保留背包,去除背景”。它准确生成了独立背包图像。但对比原图中的背包样式,存在一定差异,说明基于已有图像进行精确复现仍存在不稳定性。

随后我尝试修改材质颜色,生成结果中背包整体造型高度一致,仅颜色不同,表明 DALL·E 3 在风格与结构一致性方面表现良好——优于 MidJourney,略逊于 Stable Diffusion。不过,对普通用户而言,Stable Diffusion 实现类似效果难度极高,而 ChatGPT + DALL·E 3 已能达成较实用的水平。

接下来我尝试在背包上添加品牌 Logo,指定中文名称“探索者”。结果显示中文呈现为乱码,说明当前 DALL·E 3 对中文文本渲染支持尚不完善。但当我改用英文品牌名时,生成结果准确无误。这表明 DALL·E 3 具备稳定嵌入准确文字的能力,目前主要针对英文优化,中文适配仍在进行中。单就文字生成稳定性而言,DALL·E 3 已明显领先 MidJourney。

另一个典型应用场景是:根据古诗词生成契合意境的图像。例如,为小学生背诵古诗提供可视化辅助——将抽象诗句转化为具象画面,有助于加深理解和记忆。MidJourney 或 Stable Diffusion 无法理解诗句含义,而 ChatGPT 能准确解析文本语义,因此生成图像更贴合诗意。

我以一首诗为例生成首张图后,要求对图像进行局部调整(如改变构图角度或元素比重),结果新图在山体、香炉等核心元素上保持高度一致,仅视角与比例略有变化,说明其风格与结构控制能力较强。这种能力也适用于讲故事场景:输入故事文本,即可生成配套插图。

再看一个进阶案例:我请 ChatGPT 描述《小王子》中9个经典场景,再指令其以“顶级儿童插画师风格”逐幅生成插画。虽然部分画面与原著细节略有出入,但人物形象(如小王子)和整体艺术风格高度还原,已达到可实际用于绘本或教学素材的可用程度。

综上,DALL·E 3 在语义理解、风格一致性、文字嵌入准确性等方面展现出显著进步,尤其适合教育、内容创作、设计初稿等轻量级图像生成需求。