GPT Image 2 盲测实测:文字渲染突破,超越 Nano Banana Pro
更新背景:算力重分配下的新纪元
2026 年 4 月初,AI 图像生成领域迎来重大变局。随着 OpenAI 宣布关停高耗能的视频生成应用 Sora,大量算力资源被释放。与此同时,独立开发者 Pieter Levels 在 X 平台上率先爆料,LMArena 盲测平台上出现了三个神秘代号:maskingtape-alpha、gaffertape-alpha 和 packingtape-alpha。
这些代号虽看似随意,但其生成的图像质量却让整个社区炸开了锅。更关键的线索在于,当用户询问模型身份时,模型自称来自 OpenAI。结合 GPT Image 1.5 此前登顶排行榜的表现,社区普遍推测这三位一体模型即为备受期待的 GPT Image 2。目前这三个模型已从 Arena 移除,暗示正式发布可能近在咫尺。
核心突破:攻克文字渲染与世界知识
本次盲测最引人注目的成果,在于 GPT Image 2 对长期困扰行业的两大痛点的突破。
1. 文字渲染:从“乱码”到“教科书级”
传统扩散模型在生成文字时往往出现拼写错误、字母变形或排版混乱。GPT Image 2 采用自回归架构,显著提升了语义理解能力。
- 解剖图精度:测试显示,模型生成的肌肉解剖图中,骨骼、神经和血管的标注文字清晰准确,达到教科书级别。
- UI 还原度:在 YouTube 首页截图测试中,视频缩略图、标题文字及 UI 元素均无失真,甚至能正确渲染日文假名和汉字。
- 细节掌控:在手表时间渲染测试中,GPT Image 2 成功显示了具体时间,而 Nano Banana Pro 则完全失败。
社区用户 @avocadoai_co 评价道:“文字渲染简直是疯了(The text rendering is just absolutely insane)。”
2. 世界知识:从“幻觉”到“真实感”
模型展现了惊人的常识推理能力。
- 场景还原:在“普通工程师的屏幕”和“年轻女性与 Sam Altman 自拍”等提示词下,模型生成的图像细节丰富,符合现实逻辑。
- 游戏截图:在 Minecraft 第一人称视角测试中,maskingtape-alpha 成功还原了曼哈顿背景下的游戏场景,超越了同系列其他模型。
短板分析:空间推理仍是硬伤
尽管进步巨大,GPT Image 2 并非完美。
- 空间逻辑缺失:在经典的“魔方镜面反射”测试中,模型仍未能准确渲染魔方在镜子中的倒影,显示出三维空间推理能力的不足。
- 物理质感:部分早期反馈指出图像仍带有轻微的“塑料感”,但在最新 tape 系列中,这一问题已得到显著改善。
对开发者与用户的价值
- 评测基准升级:对于 AI 生图用户,GPT Image 2 的出现标志着评测维度需从“画面美感”转向“文字准确性”与“逻辑自洽性”。建议建立包含文字渲染、UI 还原、人物细节的三维评测体系。
- 工具链优化:利用 YouMind 等平台,将不同版本的 Prompt 与生成结果保存至 Board,便于在 GPT Image 2 正式发布后进行横向对比。
- 生态预期:随着 OpenAI 在图像领域的加倍押注,预计未来将涌现更多针对特定场景(如电商海报、UI 设计)优化的专用模型。
总结
GPT Image 2 的泄露标志着 AI 图像生成进入了新阶段。虽然空间推理仍是行业共性短板,但文字渲染与世界知识的突破已让 Nano Banana Pro 不再是唯一标杆。对于创作者而言,现在是建立个人评测体系的最佳时机,静待正式版上线。
注:本文基于社区盲测数据整理,正式发布版本可能存在差异。