模型发布 - AI 资讯
20万页 智能选型深度横向博弈,紧密跟踪前沿大模型发布与 AI 落地实战应用解析。
Kimi 发布 WorldVQA:首个聚焦原子级视觉世界知识的 MLLM 评测基准
Kimi 团队正式发布 WorldVQA,这是一个旨在衡量多模态大语言模型(MLLMs)原子级视觉世界知识事实正确性的全新基准。该数据集包含 3500 个高质量图文对,覆盖自然、地理、文化等 9 大类,并严格区分长尾知识。评测显示,即便是顶尖模型在长尾知识上的准确率也常低于 50%,且普遍存在过度自信(Overconfidence)问题。Kimi-K2.5 在该基准上表现最佳,ECE 为 37.9%,Slope 为 0.550,但仍需大幅提升自我认知能力。
HeyGen 发布双 AI 虚拟人功能:重塑对话式视频生产流程
HeyGen 正式推出“双 AI 虚拟人(Dual AI Avatars)”功能,支持两个数字角色在视频中自然对话、互动及交换信息。该功能旨在替代传统真人拍摄,适用于培训、专家访谈、FAQ 视频及数字播客等场景。核心优势在于大幅降低制作成本、加速内容迭代,并支持多语言本地化。本文深度解析其技术架构与应用价值。
LocalBanana 发布六槽位提示词工程指南:基于 9599 条数据的实测优化
LocalBanana 基于其数据库中 9,599 条高质量 AI 图像提示词(Prompts)的深度分析,正式推出《六槽位提示词工程指南》。该指南通过数据实证指出,80 词以上的结构化提示词能显著提升生成质量,并提出了包含主体、场景、光线、相机、情绪与排除项的标准化框架,旨在解决用户描述模糊导致模型输出偏差的痛点。
DomoAI 发布语音驱动技术对比:Text-to-Speech 与上传音频在虚拟主播中的性能差异解析
DomoAI 最新技术博客深入对比了 Text-to-Speech (TTS) 与上传音频两种驱动虚拟主播(Talking Avatar)的技术路径。文章详细剖析了两者在情感表达、自然度及开发成本上的核心差异,并提供了针对内容创作者与开发者的实操建议,旨在帮助用户根据具体场景选择最优的驱动方案。
Dzine 发布一致性角色生成指南:打造专属 AI 虚拟人并一键生成多视角角色表
Dzine 推出终极一致性角色生成指南,支持通过文本或图像快速构建专属 AI 角色。新功能包括多模态角色训练、角色动作预设、智能蒙版替换及高清角色表(Character Sheet)一键生成。开发者可借此实现品牌虚拟人标准化,大幅降低重复建模成本,提升内容生产效率。
Kacha AI 发布个性化人像生成技术:从自拍到艺术杰作的全流程解析
Kacha AI 正式发布其核心人像生成技术,通过‘三步走’流程实现从普通自拍到艺术级 AI 照片的转化。该系统采用用户专属微调模型,结合面部关键点映射与多风格库,支持经典、现代及奇幻等多种艺术风格。其技术突破在于将通用大模型转化为针对个人特征的个性化 Agent,确保输出图像在保持高保真度的同时,完美复刻用户面部特征与个性风格,适用于社交媒体头像、毕业纪念册及商业肖像定制等场景。
Day of AI 发布首个免费 K-12 分级 AI 素养课程,波士顿公立学校率先试点
Day of AI 联合波士顿市政府与公立学校系统,正式推出美国首个面向 PreK-12 学段的免费分级 AI 素养课程。该课程旨在通过系统化教学,帮助儿童建立对人工智能的批判性认知与实践能力,标志着 AI 教育从成人领域正式下沉至基础教育体系,为未来 AI 人才储备奠定基石。
OiiOii 发布多智能体视频生成工作流:5 步实现从脚本到高质量动画的自动化
OiiOii 正式推出基于多智能体(Multi-Agent)架构的视频生成解决方案,将原本耗时数周的动画制作压缩至下午即可完成。该工具通过 Scriptwriter、Character Designer、Scene Creator、Animator 及 Editor 五个专用智能体协同工作,解决了传统 AI 视频工具中角色一致性差、场景漂移等核心痛点。用户仅需输入一句话或脚本,即可自动生成包含连贯角色、稳定场景及专业音画的完整动画短片。
Atoms 发布 Iris 深度研究代理:从信息检索到洞察生成的范式跃迁
Atoms 正式推出 Iris,一款专为深度研究设计的多智能体(Multi-Agent)系统。不同于传统搜索工具的简单聚合,Iris 通过规划者、执行者与总结者的协作架构,实现了系统性三角验证与动态搜索策略。在 DeepResearch Bench 和 xbench 基准测试中,Iris 在洞察力(Insight)指标上大幅领先竞品,标志着 AI 应用从‘信息获取’向‘高质量洞察生成’的关键跨越。
二狗 PPT 发布:中文工作场景专用 AI 演示软件,重塑 PPT 制作流程
二狗 PPT 正式发布,定位为针对中文工作场景的 AI 演示软件。该工具通过自动生成大纲、智能排版及内容优化三大核心能力,解决了传统 PPT 制作效率低、风格不统一的问题。其内置中式专用模板与 PPTX 导入编辑功能,旨在辅助而非替代人类,帮助用户在述职、方案提案等场景中快速产出专业演示文稿。
DreamFace 发布 AI 直播生成器:零设备打造虚拟主播,重塑内容创作流程
DreamFace 正式推出 AI 直播生成功能,彻底消除传统直播对相机、灯光及推流软件的依赖。用户仅需上传照片或选择虚拟形象,配合脚本即可在数分钟内生成具备真实直播节奏与能量的视频。该工具支持游戏、带货、播客等多种模板,让创作者无需露脸即可测试新内容形式,大幅降低内容生产的门槛与试错成本。
Listnr 发布马拉地语 TTS 指南:打造地道区域化内容的新工作流
Listnr 正式推出马拉地语(Marathi)文本转语音(TTS)的深度应用指南,旨在帮助创作者、教育者和本地企业利用 AI 生成高质量的区域化音频。文章强调将 TTS 视为“生产流程”而非简单翻译,提供了从脚本撰写、音色选择到节奏调整的完整工作流,特别适用于 YouTube 解说、本地广告及课程制作。