ChatGPT图像2.0|乱码归零的原因
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"用AI生成的图片里加入日语文字,结果变成一堆奇怪符号"——你有过这样的经历吗?
2026年4月22日,OpenAI发布了从根本上解决这一烦恼的模型ChatGPT Images 2.0(gpt-image-2)。这不仅仅是一次普通更新,而是对图像生成AI架构(设计理念)本身的全面重构。
OpenAI于2026年4月22日正式发布了图像生成新模型"ChatGPT Images 2.0"。
ChatGPT用户可以以"ChatGPT Images 2.0"的形式使用,开发者则可通过API以"gpt-image-2"的形式调用。
发布当日即开始向ChatGPT Plus、Team、Enterprise用户推送,API也于同日开放。
上一代模型是基于DALL-E 3的"GPT Image 1.5"。
gpt-image-2是从头重新设计架构(设计理念)的全新模型。
最大的变化是整合了"推理功能(Thinking capabilities)"。OpenAI O系列(o3、o4-mini等)擅长的"深思熟虑后再给出答案"的能力,被嵌入到了图像生成的前置流程中。
首先,为什么以往的AI难以处理日语文字?
过去的大多数图像生成AI采用的是一种称为"扩散模型(Diffusion Model)"的机制,即从噪声(雪花屏)中逐步还原图像。
扩散模型存在根本性的弱点:文字在图像中仅占极少数像素(点),而训练数据大多为英语、拉丁字母的模型,无法精确再现日语复杂的字形。
一个汉字包含多个笔画和微妙的形态差异。扩散模型会对这些细节进行"大概是这个形状"的插值(拼凑),从而产生无法辨认的文字。
尤其是日语、中文、韩语、阿拉伯语等非拉丁文字,与英语相比训练数据更少,字形又更复杂,因此乱码频发。
gpt-image-2所采用的解决方案,是在绘制图像之前增加"制作设计图"的步骤。
模型在接收到提示词(指令)后,会先充分推理(思考)"文字放在哪里""字号和方向如何设置",然后再开始绘制。
打个比方,就像人类设计师以前是"不打草稿直接正式上手",现在变成了"先做线框图再进入设计"。
这一推理步骤融入了OpenAI的O系列模型,负责提前规划布局、构图和文字的空间排列。
gpt-image-2在日语、中文、韩语、阿拉伯语、孟加拉语等非拉丁文字的渲染精度达到了95%以上,OpenAI在官方博客中如此发布。
具体而言,以下表现已达到实用水平:
此外,还可以在生成过程中执行Web搜索,因此"最新产品名称""实际存在的地名的正确写法"等也能精确呈现在图像中。
除解决乱码外,gpt-image-2还具备多项功能。
① 最高2K分辨率:从以往的1024px上限提升至2048px,可满足印刷品和A3海报的需求。
② 自由宽高比:从横向3:1(超宽横幅)到纵向1:3(智能手机竖屏),可按1档步进指定,适配各社交媒体平台的最优尺寸。
③ 单次提示最多生成8张一致图像:在保持同一角色或世界观的前提下批量生成多个方案,大幅提升漫画页面排版和A/B测试素材创作的效率。
④ 联动Web搜索:生成过程中可搜索互联网获取最新信息,能够制作反映时事的视觉内容,或参照真实Logo、商品外观的图像。
⑤ 自检功能:生成后对输出进行自我评估,若质量不达标则尝试重新生成,大幅减少反复点击"再生成一张"的麻烦。
截至2026年4月,市面上主要的图像生成AI有多款,以下按用途整理:
如果需要在图像中加入日语文字,截至2026年4月,gpt-image-2的精度最高——多份评测的结论一致如此。
另一方面,如果追求写实人物照片风格或独特的艺术感,Midjourney v8依然强势;若希望在商用层面完全规避许可证风险,Adobe Firefly是备选方案。
据一位广告公司设计师介绍,"日语横幅用gpt-image-2,面向海外的艺术类视觉用Midjourney"——按用途分开使用的案例正在增多。
以往,"要制作含日语文字的横幅,先用图像生成AI打底,再用Photoshop后期添加文字"是普遍的工作流程。
gpt-image-2可以直接输出包含日语文字的完稿,因此后期处理的工作量将大幅减少。
以电商网站的促销横幅为例,以往需要①AI生成→②Photoshop添加文字→③调整尺寸→④审核,至少4个步骤。用gpt-image-2则可压缩为①一键提示→②指定尺寸输出→③审核,共3步。
单次提示生成8张一致图像与日语台词渲染的组合,有望为漫画的分镜(草稿)创作带来革命性变化。
事实上,漫画家和Webtoon作者之间,"用gpt-image-2试制分格和台词→手绘线稿"的混合创作模式正在兴起。
出版社和游戏公司也将其作为削减概念艺术阶段成本的有效手段,导入案例持续增加。
对于无法聘用专属设计师的中小企业而言,这是格外重大的消息。
能够用AI制作含日语文字的促销物料,意味着可以在削减外包设计费的同时提高更新频率。
例如餐饮店用于社交媒体发帖的菜单图、补习班和兴趣班的传单、网店的商品横幅等,以往需要外包的项目都有望实现内部化。
A. 截至2026年4月22日,适用对象为ChatGPT Plus、Team、Enterprise用户及API用户。
官方尚未宣布向免费版开放的时间,但有可能像上一代模型(GPT Image 1.5)一样逐步开放。
A. gpt-image-2的API费用约为每张图标准分辨率0.04~0.08美元(约6~12日元)。
选择2K分辨率或高质量模式费用会有所上升。每月生成1万张时,400~800美元(约6~12万日元)为参考费用。与Midjourney月费套餐相比,大批量生成时API的成本效率可能更高。
A. 根据OpenAI使用条款,gpt-image-2生成的图像允许商业使用。
但禁止用于真实人物肖像、版权内容复制及容易引起误导的内容。与Adobe Firefly不同,训练数据的商业许可未作明确说明,因此对风险敏感的企业有时会选择Firefly。
A. 基本的竖排文字已支持,但复杂布局需要确认。
在提示词中明确注明"竖排"可提高精度。建议生成多个方案后确认标点位置和避头尾(禁则处理)。商业用途务必在生成后进行人工目视核查。
A. 架构(设计)有根本性差异,最大的不同在于"是否有推理步骤"。
GPT Image 1.5是基于DALL-E 3的扩散模型,gpt-image-2则是在绘制前先经过思考步骤的自回归模型。文字精度、构图准确性以及对复杂指令的跟随能力均大幅提升。
最应该率先尝试的人,是所有定期制作含日语文字图像的创作者和营销人员。ChatGPT Plus用户可立即上手。建议从"请帮我制作一张包含日语文字的横幅"这样简单的提示词开始。
本文为 AI Friends 的交叉发布文章。