模型发布 - AI 资讯
20万页 智能选型深度横向博弈,紧密跟踪前沿大模型发布与 AI 落地实战应用解析。
AssemblyAI 发布 Universal-1:1250 万小时训练数据打造行业最强语音识别模型
AssemblyAI 正式推出其最强大的语音识别模型 Universal-1。该模型基于超过 1250 万小时的英、西、法、德四语多语言音频数据训练,在词错误率(WER)上较竞品提升 10% 以上,幻觉率降低 30%,并实现了 5 倍推理加速。Universal-1 显著提升了时间戳精度和跨语言切换能力,为开发者构建下一代语音 AI 应用提供了坚实基础。
Suno 发布 v5.5 版本:引入“人声”功能,打造最具表达力的音乐创作新纪元
Suno 正式推出 v5.5 版本,这是其最具表达力的模型迭代。核心突破包括全新推出的“人声(Voices)”功能,允许 Pro 及 Premier 用户将自身声音转化为音乐创作工具;同时上线“自定义模型(Custom Models)”与“我的品味(My Taste)”功能,深度个性化音乐风格。此次更新标志着 Suno 从通用音乐生成向“人类中心”创作模式的重大转变,强调音乐创作中人的直觉与情感。
Viggle 赋能虚拟偶像:SherryBeary 打造动态 Avatar 世界的技术实践
Viggle 与虚拟偶像创作者 SherryBeary 合作,展示其如何利用 AI 视频生成技术将静态 Zepeto 角色赋予动态生命力。通过结合 Procreate 绘图与 Viggle 的动作迁移能力,SherryBeary 实现了从手绘草图到复杂动作(如花样滑冰、后空翻)的无缝转化,重新定义了 Metaverse 内容创作的工作流,为开发者与创作者提供了低成本、高效率的虚拟形象动态化解决方案。
Exa AI 发布研究:基于强化学习的搜索代理性能突破,Exa 优于传统 SERP 基准
Exa AI 发布最新研究《How Search Quality Shapes RL Outcomes》,对比了基于 Exa 搜索与 Google SERP 的强化学习(RL)训练效果。研究发现,使用 Exa 作为后端训练搜索代理(Search Agents)在相同训练算力下能取得更高的性能表现。该研究采用 Qwen3-4B-Instruct 模型,通过 LoRA 适配器进行微调,验证了高质量实时检索对智能体决策能力的决定性影响,标志着从离线检索向高质量实时搜索代理的范式转变。
Sora 时代落幕:Kling 3.0 登顶,NVIDIA Cosmos 3 开源,AI 视频生态重大变革
2026 年 6 月,AI 视频领域迎来结构性转折。OpenAI 正式终止 Sora 应用,API 进入倒计时;Kling 3.0 以 2031 分登顶评测榜单,成为新标杆;NVIDIA 发布开源多模态世界模型 Cosmos 3,强化物理 AI 基础设施。与此同时,TikTok 与 YouTube 加大 AI 内容监管力度,行业正从“生成狂欢”转向“合规与高质量”的新阶段。
OpenRouter 推出视频生成 API:统一异步接口,支持 Seedance/Veo/Wan 多模型切换
OpenRouter 正式发布视频生成 API,旨在解决多模型集成复杂度高、切换成本大的痛点。通过统一的异步接口(POST /api/v1/videos),开发者可无缝切换 Seedance、Veo、Wan 等不同视频生成模型,无需重构代码。该 API 采用异步架构,分离提交与完成流程,显著提升了开发效率与系统稳定性,是构建多模型视频应用的最佳实践。
LALAL.AI 发布 Andromeda 模型:新增全类吉他分离与重训钢琴 Stem
LALAL.AI 宣布其最新音频分离模型 Andromeda 正式支持吉他(Guitars)与钢琴(Piano)Stem。全新吉他 Stem 将原分开的原声与电吉他合并为单一类别,通过简化分类逻辑将分离错误率降低约 20%。同时,钢琴 Stem 基于 Andromeda 架构从零重新训练,显著提升了复杂混音中的分离纯净度。旧版 Orion/Perseus 模型仍保留以兼容现有工作流。
Otter.ai 里程碑:5000 万会议摘要与 OtterPilot 智能代理全面上线
Otter.ai 宣布成为首个突破 5000 万会议摘要里程碑的 AI 会议助手,累计转录超 10 亿场会议。新版 OtterPilot 智能代理正式上线,具备语音激活、自动跟进任务及跨平台集成能力。同时推出 Otter AI Chat 与垂直领域的销售助手,标志着会议记录从“被动存储”向“主动执行”的范式转变。
Luma AI 发布 Ray 3.2:打造 TikTok 原生感视频内容的新一代 AI 引擎
Luma AI 正式推出 Ray 3.2 模型,专为解决品牌内容在 TikTok 上缺乏“原生感”的痛点而设计。该更新强化了垂直 9:16 格式优化、视频重定向(Reframe)及跨平台一致性工作流。通过 Agent 系统,Luma AI 实现了从创意构思到多语言本地化变体的全链路自动化,帮助创作者在保持品牌调性的同时,快速生成符合算法推荐机制的短视频内容。
Exa AI 开源 WebCode 评估框架:破解代码搜索 Agent 幻觉与噪声难题
Exa AI 正式开源 WebCode 评估框架,旨在解决代码搜索 Agent 在检索阶段面临的噪声污染与上下文污染问题。该框架通过‘黄金提取’(Golden Extraction)与多模态渲染技术,构建了比传统参数化记忆更可靠的评估基准。数据显示,Exa 在内容完整性、代码召回率及结构保持度上均显著优于主流竞品,为开发者提供了衡量代码检索质量的新标准。
Qodo 10 月重磅更新:多模型支持、智能代码审查与最佳实践对齐全面升级
Qodo 于 2024 年 10 月发布多项核心功能,涵盖 Qodo Gen 聊天交互优化、多模型支持(Claude 3.5、o1 系列等)、基于 .best_practices.md 的合规对齐、以及 Qodo Merge 的智能代码审查与变更追踪。此次更新显著提升了开发者在复杂项目中的上下文保持能力、代码质量把控及团队协作效率,标志着 Qodo 从单一工具向企业级 AI 工程平台迈进。
Rask.ai 2026 重磅升级:以 135+ 语言与真人语音克隆重塑 AI 视频本地化生态
Rask.ai 在 2026 年迎来重大功能迭代,正式确立其作为 HeyGen 等生成式 AI 视频平台之外,专注于“现有视频本地化”的领军者地位。平台新增 135+ 语言支持,核心突破包括真人语音克隆(Voice Cloning)、高精度口型同步(Lip Sync)及多说话人自动识别。这些功能让企业无需重新录制即可将视频内容无缝适配全球市场,解决了传统 AI 视频工具在真实素材处理上的短板。