模型发布 - AI 资讯
20万页 智能选型深度横向博弈,紧密跟踪前沿大模型发布与 AI 落地实战应用解析。
Genspark 发布自定义超级代理:一句话即可构建专属 AI 智能体
Genspark 正式推出 Custom Super Agent,通过 One-Prompt Agent Building 技术,让用户仅需输入一句话即可在几分钟内构建出具备专业级能力的 AI 智能体。该功能无需代码,自动配置架构与模型,并开放了 Custom Super Agent Store 供用户分享与复用,彻底降低了 AI 代理的构建门槛。
小红书发布 UniNote:统一多模态嵌入,重构搜索与推荐架构
小红书推出 UniNote 模型,旨在打破文本、图像、音频和视频的模态壁垒,将各类内容映射至单一共享向量空间。通过两阶段训练策略(InfoNCE 损失与 Hard Negative Mining)及检索 - 排名统一框架,UniNote 在跨模态检索任务中实现了高达 26 个百分点的 NDCG@10 提升。该方案致力于简化系统架构,减少因模型分裂导致的语义漂移,为构建高效的多模态搜索与推荐系统提供了新范式。
Qwen3.8-Max 与 Kimi K3 深度对决:参数规模、架构差异与开发者选型指南
ZenMux 发布深度对比报告,解析 Qwen3.8-Max 与 Kimi K3 在参数规模、架构设计及长程代理任务中的表现。Kimi K3 以 2.8 万亿参数(1040 亿激活)略胜 Qwen3.8-Max(2.4 万亿/950 亿),但两者均支持百万级上下文。文章指出,由于评估基准与 Agent 框架差异,暂无绝对胜负,建议开发者根据成本结构(Qwen 输入更优,Kimi 缓存命中可能更优)及具体业务场景(如长程软件工程 vs 多模态知识工作)进行决策。
AssemblyAI 发布 Universal 2.0:英语、德语、西班牙语语音转写精度与速度双重突破
AssemblyAI 于 2025 年 2 月 20 日推出 Universal 2.0 模型,重点优化英语、德语和西班牙语的语音转写能力。相比 2024 年 10 月版本,新模型在推理速度提升 27.4% 的同时,大幅降低了单词错误率(WER)。针对企业级应用痛点,新模型在专有名词识别(PNER)、数字格式(如邮箱、电话)及重音口音处理上实现了显著改进,解决了传统 ASR 评估中忽视的“最后一公里”问题。
Pika 发布 PikaStream 1.0:实时视频聊天引擎,实现 Agent 面对面交互
Pika 正式推出 PikaStream 1.0,旨在解决现有视频生成模型无法支持实时交互的痛点。该引擎在单张 H100 GPU 上实现了 24 FPS、480p 的实时视频生成,端到端语音转视频延迟低至 1.5 秒。通过 FlashVAE、9B DiT 及多奖励 RLHF 技术,Pika 让 AI Agent 具备面部表情、自然手势和持久记忆,真正实现了类人化的实时视频对话体验。
Suno Studio 2.0 重磅发布:引入 MIDI 编辑、智能插件设计与自动化曲线,重塑音乐创作流程
Suno 正式推出 Studio 2.0,针对专业音乐人需求进行深度重构。核心更新包括原生 MIDI 导入与编辑、基于对话的智能插件设计、先进的人声/乐器分离以及全新的自动化曲线功能。此次更新旨在打破 AI 与 DAW 的界限,让创作者能以传统乐器交互方式,实现从灵感火花到成品的高保真输出。
Photoroom 2026 电商背景移除新标准:45 图实测中准确率领跑,硬边缘处理突破
Photoroom 发布 2026 年电商背景移除工具深度评测,在 45 张电商图片的严格测试中,以 42 张完美抠图成绩领跑,远超 Remove.bg 和 Clipdrop。文章重点揭示了该工具在处理复杂边缘(如发丝、透明包装、细链条)方面的技术突破,为开发者与电商运营者提供了选择 AI 工具的核心依据。
Higgsfield 2026 发布全新食品广告 AI 工作流:从单图到电影级视频的全流程解决方案
Higgsfield 于 2026 年 8 月正式发布全新食品广告 AI 工作流,旨在解决传统视频制作中“单镜头拍摄”的局限。该平台通过 Marketing Studio 提供六大预设模板与自由提示词路径,支持从产品照片上传、分镜脚本规划、多镜头生成到最终剪辑的完整闭环。核心突破在于实现了不同生成路径(预设/提示词)生成的素材在光影与风格上的无缝兼容,并针对食品质感(如蒸汽、酱汁流动)提供了精细化的提示词优化指南,助力品牌快速产出电影级食品广告。
Black Forest Labs 发布 FLUX 3 多模态模型:统一图像、视频与机器人动作的下一代 AI 架构
Black Forest Labs 正式推出 FLUX 3 多模态 AI 模型,旨在取代分散的图像、视频及机器人工具。该模型家族涵盖视频生成(含同步音频)、图像编辑、机器人动作预测及开源本地部署版本。核心突破在于将单一架构应用于跨媒体任务,显著降低开发复杂度,并支持从创意生成到物理世界控制的端到端工作流。
二狗 PPT 发布:AI 驱动中式职场演示,重构 PPT 制作与记忆逻辑
二狗 PPT 正式推出 AI 演示工具,内置中式职场专属模板,支持内容识别排版与标准 PPTX 导出。针对 PPT 制作痛点,官方发布关于快捷键记忆与高效操作指南,强调高频快捷键(Ctrl+C/V/S/Z)的肌肉记忆训练,并提示用户注意版本兼容性与输入法冲突问题,旨在通过工具与技巧结合提升职场演示效率。
Typecast 推出 AI 配音功能:让脚本‘开口说话’,重塑内容本地化体验
Typecast 正式推出 AI Dubbing(AI 配音)功能,利用先进的语音合成与情感模拟技术,将静态脚本转化为生动、自然的语音内容。该功能支持多语言本地化,能够精准还原演讲者的语气、停顿与情感起伏,大幅降低视频制作成本,为开发者与内容创作者提供从文本到高质量音频的一站式解决方案。
Mubert 发布开发者音频引擎:基于认知科学的动态音乐生成技术
Mubert 正式推出专为开发者设计的音频生成引擎,基于认知心理学研究,提供 150+ 种情绪与场景的动态音乐生成。该工具通过消除传统播放列表的“轨道切换中断”,利用 AI 实时生成无歌词、无结构的连续声景,帮助开发者在重复性任务中提升效率,在复杂调试时保持专注。API 支持毫秒级流式传输,旨在成为开发者工作流的智能背景层。