ChatGPT 이미지 2.0|글자 깨짐이 사라진 이유
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"AI로 만든 이미지에 일본어 텍스트를 넣었더니, 정체 모를 기호들로 가득 찼다"——그런 경험을 한 적이 있으신가요?
2026년 4월 22일, OpenAI가 그 고민을 근본적으로 해결하는 모델 ChatGPT Images 2.0(gpt-image-2)을 발표했습니다. 단순한 업데이트가 아니라, 이미지 생성 AI의 아키텍처(설계 사상)자체를 새로 만든 대전환입니다.
OpenAI는 2026년 4월 22일, 이미지 생성의 새로운 모델 'ChatGPT Images 2.0'을 공식 릴리스했습니다.
ChatGPT 사용자는 'ChatGPT Images 2.0'으로, 개발자는 API를 통해 'gpt-image-2'로 이용할 수 있습니다.
발표 당일부터 ChatGPT Plus·Team·Enterprise 사용자에 대한 롤아웃이 시작되었으며, API도 즉시 개방되었습니다.
전세대 모델은 DALL-E 3을 기반으로 한 'GPT Image 1.5'였습니다.
gpt-image-2는 아키텍처(설계 사상)를 처음부터 새로 만든, 완전히 다른 모델입니다.
가장 큰 변화는 '추론 기능(Thinking capabilities)'의 통합입니다. OpenAI의 O 시리즈(o3, o4-mini 등)가 특기로 하는 '충분히 생각하고 나서 답하는' 능력을 이미지 생성의 전처리 단계에 내장했습니다.
그렇다면, 왜 기존 AI는 일본어 텍스트를 잘 처리하지 못했을까요?
지금까지의 이미지 생성 AI 대부분은 '확산 모델(Diffusion Model)'이라 불리는 방식을 채택하고 있었습니다. 노이즈(잡음)에서 조금씩 이미지를 복원해가는 방법입니다.
확산 모델에는 근본적인 약점이 있습니다. 텍스트는 이미지 안에서 극히 일부 픽셀(점)만을 차지하기 때문에, 학습 데이터의 대부분이 영어·라틴 문자인 모델로는 일본어의 복잡한 자형을 정확하게 재현할 수 없습니다.
한자 한 글자에는 여러 획과 미묘한 형태의 차이가 있습니다. 확산 모델은 그 세부 사항을 '대략 이런 모양'으로 보간(이어 맞추기)해버리기 때문에, 읽을 수 없는 글자가 생겨났습니다.
특히 일본어·중국어·한국어·아랍어 등 비라틴 문자는 영어에 비해 학습 데이터가 적은 데다 자형이 복잡하여, 글자 깨짐이 빈번하게 발생했습니다.
gpt-image-2가 채택한 해결책은, 이미지를 그리기 전에 '설계도를 만드는' 단계를 추가하는 것입니다.
프롬프트(지시문)를 받은 모델은 우선 '어디에 텍스트를 배치할지' '글자의 크기와 방향을 어떻게 할지'를 충분히 추론(검토)한 후, 그리기를 시작합니다.
인간 디자이너에 비유하자면, 예전에는 '러프도 그리지 않고 바로 본 작업'을 했던 것이, '와이어프레임을 만들고 나서 디자인에 들어가는' 방식으로 바뀐 느낌입니다.
이 추론 단계에는 OpenAI의 O 시리즈 모델이 내장되어 있으며, 레이아웃·구도·텍스트의 공간 배치를 사전에 계획합니다.
gpt-image-2는 일본어·중국어·한국어·아랍어·벵골어 등 비라틴 문자의 텍스트 렌더링 정확도가 95% 이상에 달했다고, OpenAI가 공식 블로그에서 발표했습니다.
구체적으로는 다음과 같은 표현이 실용적인 수준에서 가능해졌습니다.
또한 웹 검색 기능을 생성 중에 실행할 수 있기 때문에, '최신 제품명'이나 '실재하는 지명의 정확한 표기'도 이미지 안에 정확하게 담아낼 수 있습니다.
글자 깨짐 해소 외에도, gpt-image-2는 다양한 기능을 갖추고 있습니다.
① 최대 2K 해상도:기존의 1024px 상한에서 2048px로. 인쇄물이나 A3 포스터에도 충분한 해상도입니다.
② 자유로운 종횡비:가로 3:1(초횡장 배너)부터 세로 1:3(스마트폰 세로형)까지, 단계별로 지정 가능. SNS 플랫폼별 최적 사이즈에 대응합니다.
③ 1개의 프롬프트로 최대 8장 일관 생성:동일한 캐릭터나 세계관을 유지한 채 여러 패턴을 일괄 생성. 만화의 페이지 구성이나 A/B 테스트용 변형 제작이 한 번에 효율화됩니다.
④ 웹 검색과의 연동:생성 중에 인터넷을 검색하여 최신 정보를 반영할 수 있습니다. 시사 내용을 담은 비주얼이나, 실재하는 로고·제품 외형을 참조한 이미지를 만들 수 있습니다.
⑤ 자체 검사 기능:생성 후 출력을 자체 평가하여 품질이 낮을 경우 재생성을 시도합니다. '한 장 더 생성'을 반복해서 누르는 수고가 대폭 줄어듭니다.
2026년 4월 기준으로 주요 이미지 생성 AI는 여러 가지가 있습니다. 용도별로 정리합니다.
한국어 텍스트를 이미지에 넣는 용도라면, 2026년 4월 기준으로 gpt-image-2가 가장 정확도가 높다는 평가가 여러 리뷰에서 일치하고 있습니다.
반면, 사실적인 인물 사진 풍의 생성이나 독특한 예술적 터치를 원한다면 Midjourney v8이 여전히 강하고, 상업적 이용에서 라이선스 면의 리스크를 완전히 배제하고 싶다면 Adobe Firefly가 선택지가 됩니다.
한 광고대행사 디자이너의 이야기에 따르면, "한국어 배너는 gpt-image-2, 해외용 아트 계열 비주얼은 Midjourney"라고 용도별로 구분하여 사용하는 사례가 늘고 있다고 합니다.
지금까지는 '일본어 텍스트가 들어간 배너를 만들 때는, 이미지 생성 AI로 토대를 만들고 Photoshop에서 글자를 나중에 삽입'하는 워크플로우가 일반적이었습니다.
gpt-image-2라면 일본어 텍스트를 포함한 완성품을 바로 출력할 수 있기 때문에, 후처리 공수가 대폭 절감됩니다.
EC 사이트의 세일 배너를 예로 들어 보겠습니다. 기존에는 ①AI 생성→②Photoshop에서 글자 삽입→③사이즈 조정→④확인, 최소 4단계가 필요했습니다. gpt-image-2라면 ①프롬프트 한 번→②사이즈 지정하여 출력→③확인, 3단계로 압축할 수 있습니다.
1개의 프롬프트로 8장을 일관 생성하는 것과 일본어 대사 렌더링의 조합은, 만화의 네임(콘티) 작성에 혁명을 가져올 가능성이 있습니다.
실제로 만화가나 웹툰 작가들 사이에서는, 'gpt-image-2로 컷 구성과 대사를 시험 제작→선화는 손으로 그리기'라는 하이브리드 제작 스타일이 확산되고 있습니다.
출판사나 게임 회사에서도 컨셉 아트 단계에서의 비용 절감에 유효하다며 도입 사례가 늘고 있습니다.
전속 디자이너를 두기 어려운 중소기업에게는 특히 큰 소식입니다.
일본어 텍스트가 들어간 판촉물을 AI로 만들 수 있게 됨으로써, 디자인 외주 비용을 절감하면서 업데이트 빈도를 높일 수 있습니다.
예를 들어 음식점의 SNS 게시용 메뉴 이미지, 학원이나 취미 교실의 전단지, 온라인 쇼핑몰의 상품 배너 등, 지금까지 외주로 맡겼던 작업을 인하우스화할 가능성이 있습니다.
A. 2026년 4월 22일 기준으로, ChatGPT Plus·Team·Enterprise 사용자와 API 사용자가 대상입니다.
무료 플랜에 대한 개방 시기는 공식적으로 발표되지 않았으나, 전세대 모델(GPT Image 1.5)처럼 단계적으로 개방될 가능성이 있습니다.
A. gpt-image-2의 API 요금은 이미지 1장당 표준 해상도 기준으로 약 0.040.08달러(약 60120원)정도입니다.
2K 해상도나 고품질 모드를 선택하면 요금이 올라갑니다. 월 1만 장 생성하는 경우, 400800달러(약 60120만 원)가 비용의 기준입니다. Midjourney의 월정액 플랜과 비교하면, 대량 생성 시에는 API가 비용 효율이 더 좋은 경우가 있습니다.
A. OpenAI의 이용 약관상, gpt-image-2로 생성한 이미지는 상업적 이용이 허가되어 있습니다.
단, 실재하는 인물의 초상·저작권물의 복제·오해를 불러일으키는 콘텐츠에의 이용은 금지입니다. Adobe Firefly와 달리 학습 데이터의 상업적 라이선스 명시가 없기 때문에, 리스크에 민감한 기업은 Firefly를 선택하는 경우도 있습니다.
A. 기본적인 세로쓰기는 지원하나, 복잡한 레이아웃에서는 확인이 필요합니다.
프롬프트에 '세로쓰기로'라고 명시하면 정확도가 올라갑니다. 구두점의 위치나 금칙 처리는 여러 패턴을 생성하여 확인할 것을 권장합니다. 비즈니스 용도에서는 생성 후 반드시 육안으로 확인하세요.
A. 아키텍처(설계)가 근본적으로 다릅니다. 가장 큰 차이는 '추론 단계의 유무'입니다.
GPT Image 1.5는 DALL-E 3 기반의 확산 모델이었습니다. gpt-image-2는 그리기 전에 생각하는 단계를 갖는 자기회귀형 모델입니다. 텍스트 정확도·구도의 정확성·복잡한 지시 따르기 능력이 모두 대폭 향상되었습니다.
우선 사용해봐야 할 사람은, 한국어 텍스트가 들어간 이미지를 정기적으로 만드는 모든 크리에이터와 마케터입니다. ChatGPT Plus 사용자라면 바로 사용할 수 있습니다. 처음에는 '한국어 글자가 포함된 배너를 만들어줘'라는 간단한 프롬프트부터 시작해 보세요.
이 글은 AI Friends의 크로스포스트입니다.