首页 AI资讯 OpenAI 推出全新旗舰模型 GPT-4o:实现实时音视频原生双向交互
GPT-4oRealtime Omni Engine
模型发布

OpenAI 推出全新旗舰模型 GPT-4o:实现实时音视频原生双向交互

ADK ADK 资讯组 2024-05-14 5 分钟 12,450 次浏览

摘要: OpenAI 正式发布了全新的旗舰大模型 GPT-4o(“o” 代表 omni 意为全能)。该模型在 GPT-4 级智能水平上实现了速度上的飞跃,并且在文本、语音、视觉等跨模态原生交互上取得了颠覆性突破,普通用户可免费使用。

🚀 迈向实时人机交互新纪元

在五月的春季产品发布会上,OpenAI 带来了极具震撼力的 GPT-4o 模型。GPT-4o 是 OpenAI 首个端到端原生多模态模型。这意味着,模型并非由多个独立的语音、视觉与文本模型串联而成,而是所有的模态输入均由同一个庞大的神经网络进行端到端(End-to-End)直接处理。

这一技术跨越带来了颠覆性的性能革新:

  • 超低语音延迟:平均 320 毫秒语音响应(最快 232 毫秒),与人类交谈速度几乎吻合。
  • 原生情绪感知:省去 ASR/TTS 中介,可直接听出语气、笑声、呼吸甚至歌声。
  • 卓越的视觉理解:实时看懂手写公式、代码屏幕或周围环境并解说纠错。

🛠 技术原理分析

传统的多模态语音系统由 ASR、LLM、TTS 三个模型拼接构成管道(Pipeline),存在累加延迟高达 2-5 秒、中间转换丢失情绪/语速/音高等信息的两大硬伤。

GPT-4o 改变了游戏规则:它是一个统一的 Transformer 架构,直接处理包含文字、视觉和音频的所有输入,特征提取与情感对齐在单个网络中完成,展现出类似真人的高情商对话能力。

📊 性能基准测试

在多项公开权威测试集中,GPT-4o 在文本、推理、代码能力上超越前代 GPT-4 Turbo,在多语言(尤其中日韩)及视觉理解方面创下行业最高分。全新 Token 编解码器对非英语字符压缩效率提升 1.1x 至 4.4x,中文用户 Token 消耗量大幅缩减。

Key Insights / 核心看点

  • 1 原生多模态:文本、视频、语音由单神经网络端到端原生处理,不经过 ASR/TTS 串联。
  • 2 超低延迟体验:语音对话延迟降至 232ms-320ms,与人类无异,支持随时打断插话。
  • 3 情绪表达力:能自如模拟各种音调、语气、低语或歌唱,完美捕捉并表达细腻情感。
  • 4 全员免费开放:免费版用户可体验 GPT-4o 的核心智能,PLUS 会员享有 5 倍额度。

GPT-4o 让我们第一次真正看到了实时、无缝人机共生交互的未来形态。这感觉不像是科幻,它真实得甚至有点不真实。

Sam Altman, OpenAI CEO
平均语音延迟 320 ms 逼近人类 200ms 的生理交谈响应极限
非英文字符压缩率 最高 4.4x 中日韩等小语种推理效率大幅飙升
MMLU 理解准确率 88.7% 在综合学科理解基准上再次刷新行业纪录