模型发布 - AI 资讯
20万页 智能选型深度横向博弈,紧密跟踪前沿大模型发布与 AI 落地实战应用解析。
Google DeepMind 发布 Lyria 3.5:支持 184 秒长曲与 expressive 人声,重塑音乐生成工作流
Google DeepMind 正式推出 Lyria 3.5,在 Google Flow Music 平台上线。此次更新核心突破在于将最大生成时长从 30 秒扩展至 184 秒(约 3 分 4 秒),并显著提升了人声的情感表达力、多语言发音清晰度及长曲结构连贯性。该版本专为广告、游戏配乐及教育场景设计,支持通过结构化提示词(如 [Verse]、[Chorus])和精确的时间戳控制歌曲编排,大幅降低长曲生成的试错成本。
Nexu 发布 Sol-RL 技术:以低成本扩散模型强化学习重塑品牌定制图像生成经济
Nexu 宣布通过 Sol-RL(Style Optimization via Reinforcement Learning)技术,大幅降低扩散模型(Diffusion Model)的定制成本。该技术利用低成本强化学习替代传统昂贵的微调(Fine-tuning)策略,解决了初创团队在品牌一致性、产品真实感及合规性上的痛点。Nexu 强调,其核心价值在于为开发者提供从‘无限提示重试’到‘管理化视觉流水线’的转型方案,显著减少 GPU 浪费并提升商业转化率。
Google 发布 Gemini 3:重塑多模态推理与长任务规划能力
Google 正式推出 Gemini 3,其核心突破在于重构了推理引擎,实现了更深层次的多模态理解与结构化长任务规划。该模型支持文本、图像、视频及音频的统一处理,具备处理整本书籍或长会议记录的超长上下文窗口,并能在复杂任务中自主拆解步骤、调用工具。文章详细解析了其在搜索交互、软件开发及企业级工作流中的实际应用价值,同时探讨了成本与部署的局限性。
Sudowrite 发布 Muse 专用模型:专为暗黑言情与复杂剧情打造,打破内容安全限制
Sudowrite 正式推出其专属小说模型 Muse,专为暗黑言情、惊悚及高难度剧情场景设计。针对 ChatGPT 等通用大模型因安全策略导致的“软性处理”问题,Muse 支持描写暴力、亲密关系及复杂的道德困境,保留角色的阴暗面与复杂性。文章详细展示了如何利用 Story Bible 构建深度人物档案与世界观,确保 AI 生成内容在风格、逻辑与情感张力上高度一致,彻底解决创作中的内容阻塞问题。
Rows 发布 REST API 与矩阵数据类型:开启企业级电子表格自动化新纪元
Rows 正式推出 REST API,支持读写企业级电子表格数据,并引入创新的 Matrix 数据类型以解决多维数据关联难题。此次更新标志着 Rows 从单一协作工具向自动化数据中台转型,为开发者提供了构建复杂数据分析应用的全新接口,大幅降低了企业数据处理的门槛。
Label Studio 发布失败数据标注新范式,重塑 VLA 机器人鲁棒性训练
Label Studio 基于最新 VLA 研究趋势,深度解析为何‘成功数据’训练会导致机器人脆弱,并推广包含检测、分类、因果与恢复动作的完整失败数据标注架构。文章指出,仅保留成功演示的旧范式已无法应对现实世界的扰动,Label Studio 助力团队构建如 RoboFAC、FailSafe 等新型数据集,将失败转化为可执行的监督信号,显著提升机器人在复杂环境下的恢复能力与泛化性能。
Capsule 发布 Video First 架构:重塑 AI 视频生成与多模态交互新范式
AI 视频生成工具 Capsule 正式推出 Video First 核心架构,彻底重构了从文本到视频的创作流程。该更新不仅大幅提升了视频生成的时序一致性与物理真实性,更引入了原生多模态上下文理解能力,使开发者能够构建更复杂的交互式视频应用。此次升级标志着 AI 视频领域从‘片段拼接’向‘原生生成’的范式转移。
GitLab 19.3 发布 Flow Creator Agent:让业务专家用自然语言构建自动化工作流
GitLab 19.3 正式推出 GitLab Duo Agent Platform 中的 Flow Creator Agent,彻底打破自动化工作流构建的技术壁垒。该功能允许用户通过自然语言描述需求,自动生成可执行的 YAML 工作流定义。通过引入基础代理架构、严格的服务账户权限隔离及预输出检查清单,GitLab 确保了非技术人员也能安全地构建复杂自动化流程,有效弥合了业务知识与技术实现之间的鸿沟。
Felo 发布 Fable 5.1 模型升级:Felo Pro 用户享 7 天半价权益,深度研究能力全面跃升
Felo 正式将核心研究引擎 Fable Research 升级为 Fable 5.1 模型,旨在解决复杂多源信息整合与深度对比分析难题。此次升级不仅显著提升了 Agent 在整理信息、比较选项及撰写专业简报方面的能力,更针对 Felo Pro 用户推出了为期 7 天的半价信用额度优惠活动。对于需要进行市场竞品分析、深度调研或复杂决策支持的用户而言,这是一次低成本试水高阶深度研究能力的绝佳机会。
CrePal 上线 ControlNet-OpenPose-SDXL 1.0:实现高精度人体姿态可控图像生成
CrePal 正式上线基于 Stable Diffusion XL 1.0 的 ControlNet-OpenPose-SDXL 1.0 模型,专为解决 AI 绘画中人体姿态难以控制的问题。该模型通过 OpenPose 骨骼线框作为条件输入,实现了高达 0.357 的平均精度(mAP),在多人场景、手部细节及面部表情生成上表现卓越,为创作者提供了前所未有的姿态控制能力。
CrePal 上线 FLUX.1-Schnell:1-4 步生成秒级高质量图像,Apache 2.0 商用免费
CrePal 正式集成 Black Forest Labs 发布的 FLUX.1-Schnell 模型,提供在线免费图像生成服务。该模型基于 120 亿参数架构,仅需 1-4 个推理步即可生成高质量图像,速度比传统扩散模型快 10 倍以上。采用 Apache 2.0 协议,支持完全商用,无需付费即可享受专业级画质。
Google 发布 Nano Banana 2:Krea 平台迎来新一代图像生成引擎,支持多语言文字渲染与角色一致性
Google DeepMind 最新图像模型 Nano Banana 2 (NB2) 现已在 Krea AI 平台上线。NB2 实现了从“生成图片”到“生成可用内容”的跨越,核心突破包括原生多语言文字渲染、复杂场景下的角色一致性保持、以及基于 Gemini 知识的结构化视觉构建。该模型支持 4K 分辨率输出,显著提升了海报、UI 原型及信息图表的生产效率。