模型发布 - AI 资讯
20万页 智能选型深度横向博弈,紧密跟踪前沿大模型发布与 AI 落地实战应用解析。
Capsule 发布 Video First 架构:重塑 AI 视频生成与多模态交互新范式
AI 视频生成工具 Capsule 正式推出 Video First 核心架构,彻底重构了从文本到视频的创作流程。该更新不仅大幅提升了视频生成的时序一致性与物理真实性,更引入了原生多模态上下文理解能力,使开发者能够构建更复杂的交互式视频应用。此次升级标志着 AI 视频领域从‘片段拼接’向‘原生生成’的范式转移。
GitLab 19.3 发布 Flow Creator Agent:让业务专家用自然语言构建自动化工作流
GitLab 19.3 正式推出 GitLab Duo Agent Platform 中的 Flow Creator Agent,彻底打破自动化工作流构建的技术壁垒。该功能允许用户通过自然语言描述需求,自动生成可执行的 YAML 工作流定义。通过引入基础代理架构、严格的服务账户权限隔离及预输出检查清单,GitLab 确保了非技术人员也能安全地构建复杂自动化流程,有效弥合了业务知识与技术实现之间的鸿沟。
Felo 发布 Fable 5.1 模型升级:Felo Pro 用户享 7 天半价权益,深度研究能力全面跃升
Felo 正式将核心研究引擎 Fable Research 升级为 Fable 5.1 模型,旨在解决复杂多源信息整合与深度对比分析难题。此次升级不仅显著提升了 Agent 在整理信息、比较选项及撰写专业简报方面的能力,更针对 Felo Pro 用户推出了为期 7 天的半价信用额度优惠活动。对于需要进行市场竞品分析、深度调研或复杂决策支持的用户而言,这是一次低成本试水高阶深度研究能力的绝佳机会。
CrePal 上线 ControlNet-OpenPose-SDXL 1.0:实现高精度人体姿态可控图像生成
CrePal 正式上线基于 Stable Diffusion XL 1.0 的 ControlNet-OpenPose-SDXL 1.0 模型,专为解决 AI 绘画中人体姿态难以控制的问题。该模型通过 OpenPose 骨骼线框作为条件输入,实现了高达 0.357 的平均精度(mAP),在多人场景、手部细节及面部表情生成上表现卓越,为创作者提供了前所未有的姿态控制能力。
CrePal 上线 FLUX.1-Schnell:1-4 步生成秒级高质量图像,Apache 2.0 商用免费
CrePal 正式集成 Black Forest Labs 发布的 FLUX.1-Schnell 模型,提供在线免费图像生成服务。该模型基于 120 亿参数架构,仅需 1-4 个推理步即可生成高质量图像,速度比传统扩散模型快 10 倍以上。采用 Apache 2.0 协议,支持完全商用,无需付费即可享受专业级画质。
Shortcut 发布 ShortcutXL:首个原生 Excel 桌面级通用财务代理
Shortcut 正式推出 ShortcutXL,一款专为财务团队设计的原生 Excel 桌面级通用代理(Generalist Desktop Agent)。不同于受限于侧边栏或仅能读取文件的传统 AI 工具,ShortcutXL 能直接操作完整 Excel 桌面环境,支持数据表、目标求解器、VBA 宏及假设分析等原生功能。它具备多模型并行处理能力,可同步处理多个季度模型,并支持加密认证获取外部数据,彻底解决财务自动化中“最后一公里”的交互难题。
Google 发布 Nano Banana 2:Krea 平台迎来新一代图像生成引擎,支持多语言文字渲染与角色一致性
Google DeepMind 最新图像模型 Nano Banana 2 (NB2) 现已在 Krea AI 平台上线。NB2 实现了从“生成图片”到“生成可用内容”的跨越,核心突破包括原生多语言文字渲染、复杂场景下的角色一致性保持、以及基于 Gemini 知识的结构化视觉构建。该模型支持 4K 分辨率输出,显著提升了海报、UI 原型及信息图表的生产效率。
LogoAI 发布 AI 文字特效字体生成器:从排版到视觉艺术的零门槛创作
LogoAI 正式推出全新的 AI 文字特效字体生成器,彻底改变传统排版设计流程。该工具不仅提供丰富的字体库,更支持将普通文本瞬间转化为具有维度、材质、光影及特定情绪的高级视觉艺术。用户无需掌握复杂的图层操作或排版知识,只需选择风格(如奢华、复古游戏、手写签名等)并输入文字,即可在秒级时间内生成可用于品牌宣传、社交媒体及商业设计的定制化标题艺术。
xAI 发布 Grok 4.20:百万级上下文与超低幻觉的智能体引擎
xAI 正式推出 Grok 4.20,这是一款专为高性能智能体(Agent)设计的语言模型。其核心突破在于 100 万 token 的超大上下文窗口、行业领先的响应速度以及宣称的“市场最低幻觉率”。文章详细解析了其在函数调用、多模态输入及长任务执行中的优势,并对比了与其他开源及闭源模型的差异,同时介绍了无需 API 密钥即可通过 Happycapy 平台体验该模型的方法。
Krisp 发布 VIVA 2.0:为语音 AI 代理打造下一代语音基础设施
Krisp 正式推出 VIVA 2.0,旨在解决语音 AI 代理在真实生产环境中面临的音频噪声与对话逻辑两大核心痛点。该版本通过重构语音隔离引擎(v3)和引入预测式轮转检测(Turn Prediction v3),显著提升了语音识别准确率与对话流畅度。作为首个专为语音 AI 代理设计的服务器端 SDK,VIVA 2.0 已集成至多个主流语音平台,帮助开发者实现更自然、更可靠的语音交互体验。
CodeSnippets AI 深度解析:基于 GPT-4 的代码重构、调试与生成全栈解决方案
CodeSnippets AI 正式发布,依托 GPT-4 核心引擎,提供代码重构、自动调试、代码解释及自动生成等核心功能。其独特之处在于支持整个代码库的上下文索引,并兼容开源与闭源大模型,旨在成为开发者团队的知识库与生产力加速器。
Suno 宣布与 WMG 达成战略合作:解锁新一代音乐模型与艺术家共创生态
Suno 宣布与全球最大唱片公司之一 Warner Music Group (WMG) 达成战略合作。此次合作旨在通过引入高质量授权音乐数据,构建超越 v5 的新一代音乐模型,并开启艺术家与 AI 共创的新纪元。核心亮点包括:利用 WMG 版权库训练更强大的模型、推出艺术家授权内容互动功能、以及调整下载策略以区分免费与付费用户。Suno 强调这将重塑音乐创作、消费与共享的范式。