档案库 · 产品创意 · 产品决策 · 2023
OpenAI DALL·E 3(2023):ChatGPT代写提示词,你只需描述画面
DALL·E 3终结了提示词工程:原生集成在ChatGPT中,将自然语言愿望转化为定制提示词,并通过对话迭代完善图像。
OpenAI
当时的题目
Text-to-image systems ignored wording and forced users to learn prompt engineering. OpenAI wanted a model that obeyed natural, detailed descriptions — and an interface where anyone could use it without learning that skill.
它是怎么成立的
2023年9月20日,OpenAI发布了DALL·E 3,这是一个原生构建于ChatGPT之上的文生图模型。用户无需向独立工具提供手工制作的提示词,而是向ChatGPT描述需求,ChatGPT撰写详细提示词、生成图像,并通过普通对话进行细化。
它解决的问题是提示词工程:早期系统往往忽略词语,因此获得好图像需要学会编写精确、冗长的提示词。OpenAI通过使用最先进的图像描述器生成的标题来训练DALL·E 3,修复了模型侧,使模型“更加关注用户提供的标题”,并能可靠生成包含文本、手部和脸部的复杂细节。
交互侧使模型成为提示词编写者:ChatGPT与用户头脑风暴,将简单句子扩展为定制化提示词,并接受如“暖色调一点”之类的微调,无需任何语法。The Verge的演示中,首席研究员Aditya Ramesh要求ChatGPT为一家山间拉面餐厅设计标志,得到了四个选项。
OpenAI在发布时搭配了安全工作——对公众人物和在世艺术家的拒绝、红队测试、对未经修改的图像准确率超过99%的早期出处分类器,以及创作者图像的退出机制——随后于2023年10月18日向所有ChatGPT Plus和企业用户推出该功能。
妙在哪
- 消除了专家障碍:因为模型自己写提示词,初学者一句话的愿望就能产生此前需要提示词技巧才能获得的效果。
- 对话成为界面:迭代细化以自然语言进行,无需在生成之间重写提示词语法。
- 基于标题训练模型是技术推动力——使文生图引擎能够遵循详细指令,从而让聊天包装器有可靠的基础。
- 将工具嵌入ChatGPT,借助已有数亿用户的应用,将图像生成从专业工具变成主流功能。
做出来什么
From October 18, 2023, every ChatGPT Plus and Enterprise user could create and refine images conversationally, and the chat-native pattern became the default way mainstream image AI is used, carried forward by OpenAI's later GPT-4o image generation.
可以借走的
当专家输入成为障碍时,将转换过程内置于产品中:让模型将普通意图转化为专家级指令,工具便能向所有人开放。
后来
DALL·E 3从ChatGPT Plus和企业用户迅速扩展到API,成为使用最广泛的图像模型之一,微软将其添加到Bing Image Creator中。它引入的聊天原生交互——头脑风暴、生成、对话细化——成为主流图像生成的模板:OpenAI后来的GPT-4o图像模式保持图像在聊天中,竞争产品也复制了对话循环。在OpenAI内部,这也使其从独立生成器转向在ChatGPT内提供多模态能力的默认方向。
资料来源
- DALL·E 3
- DALL·E 3 is now available in ChatGPT Plus and Enterprise
- OpenAI releases third version of DALL-E
发现哪里写错了?告诉我们。
轮到你了
你刚读完一个点子。把你手上的题目说出来,看看谁接过同样的题。
免费账号 · 3 次免费提问 · 不用绑卡