Mirage News Network:Captions 24 小时 AI 新闻直播实验
Captions 团队最近发布了一项极具前瞻性的技术实验,名为 Mirage News Network (MNN)。这是一次为期 24 小时的 AI 生成新闻网络直播,旨在极端条件下测试其核心模型 Avatar X 的身份保持能力。
实验背景与目标
生成一个逼真的 AI 人物在短短 10 秒内并不困难,但让其连续保持同一身份、表情和姿态长达 24 小时,则是巨大的技术挑战。通常,随着生成时间的推移,人脸会发生漂移,眼神不再匹配参考图,姿态也会重置。
Captions 选择 24 小时作为测试时长,不仅是因为这是 X (Twitter) 平台单流的最长限制,更是为了创造一个“无法隐藏连续性错误”的极端压力环境。如果 AI 能在这一小时内保持连贯,那么它具备在更长时间尺度上工作的潜力。
核心架构与执行
整个实验由 Claude 编排,在单台机器上运行,总 Token 消耗约为 $50,000。
- 角色生成:创建了四位 AI 主播(Anchor)和多位嘉宾,均基于 Avatar X 模型。
- 音频合成:由 Mirage Audio 模型生成所有语音。
- 视觉编排:通过渲染引擎合成滚动条、数据看板、引用卡片等图形元素。
- 内容来源:报道素材来自全球新闻通讯社的授权 footage 和真实记者提供的事实,AI 负责生成呈现层(Presentation Layer)。
- 自动化流程:播放列表通过 ffmpeg 和 RTMP 链式管理,支持白天动态添加新节目,夜间单进程连续运行了 13 小时。
关键亮点与实测数据
本次实验生成了超过 100 个原创片段,并进行了严格的自动化检查,包括冻结帧检测、A/V 同步、口型对齐及版权合规性。所有出镜人物(包括 Andrew Chen 和 Lenny Rachitsky 的 AI 版)均获得了书面授权,且每帧画面均带有 AI 生成披露标识。
实验成果:
- 观众规模:超过 50,000 人实时观看直播。
- 传播数据:生成超过 300 万 次曝光(Impressions),并在 X 平台上 trending。
- 用户留存:平均观看时长约为 1 分钟。这表明虽然 AI 视频的新颖性吸引了用户停留,但长时程的叙事吸引力仍需人类介入。
技术反思与挑战
尽管视频生成令人印象深刻,但 Captions 团队也坦诚了不足:
- 身份保持的突破:Avatar X 成功在长时间跨度内维持了人物的视觉一致性,这是其核心强项。
- 音频节奏的局限:音频生成是目前的短板。部分语音的语速(Cadence)过于均匀,停顿(Pauses)遵循节奏而非语义逻辑,导致长音频缺乏自然感。
- 事实错误:实验中出现了两处事实性错误(如将抗议者误称为总统),团队在发布后一小时公开更正。
未来展望
Captions 表示,生成视频只是第一步,如何保持用户注意力是另一个难题。虽然 AI 视频技术正在快速逼近人类水平,但在长时程叙事和情感共鸣上,目前仍受限于人类经验的边界。此次实验为 AI 视频在新闻、教育及娱乐领域的规模化应用提供了宝贵的压力测试数据。
"Generating video is one problem. Holding someone's attention is another. We're getting closer on the first, but the second remains human-bound for now." —— Captions 团队