模型发布 - AI 资讯
20万页 智能选型深度横向博弈,紧密跟踪前沿大模型发布与 AI 落地实战应用解析。
Google 发布 Pics:Nano Banana 模型驱动的全链路图像生成与编辑工具
Google 于 2026 年 9 月 1 日正式推出 Pics,这是基于 Gemini 家族 Nano Banana 模型构建的新一代图像生成与编辑工具。Pics 旨在解决设计师在 Google Workspace 生态中跨应用协作的痛点,支持从文本提示生成图像、对象级精细编辑及图像内文字翻译。作为 Canva 和 Adobe Express 的潜在替代者,Pics 强调“无复制粘贴”的工作流,并面向 Google AI Pro 订阅用户及企业客户开放。
Speechify 发布 AI 播客引擎:一文变音频,1 分钟生成私人播客
Speechify 正式推出 AI Podcast 功能,利用拟真人神经网络语音技术,将任何文本(包括新闻、研报、博客)一键转化为专业级播客。用户可在网页端或 iOS 端,通过选择播客、脱口秀等多种风格,在 1 分钟内生成自然流畅的音频内容,彻底解决屏幕疲劳与碎片化阅读难题,实现真正的多任务学习与信息获取。
Wan 3.0 深度评测:30 秒长视频生成与多模态工作流突破
Alibaba 推出的 Wan 3.0 模型在公共测试版中实现了长达 30 秒的单次视频生成,支持最多 20 个参考资产(含图文音视频及文档)输入,并原生集成音频。评测显示,该模型在角色一致性、镜头语言理解及叙事连贯性上显著提升,特别适合短剧、广告及电商视频创作,但仍需人工微调以消除长时生成中的细节漂移。
Thinking Machines 发布 Inkling-Small:276B MoE 模型仅需 12B 激活参数,支持百万级上下文
Thinking Machines 正式推出 Inkling-Small,一款基于 2760 亿参数混合专家(MoE)架构的多模态开源模型。其核心突破在于仅需 120 亿激活参数即可运行,同时支持高达 100 万 token 的超长上下文窗口。该模型在 SWE-bench Verified 上取得 77.6% 的优异成绩,并在终端基准测试中以三分之一 token 成本匹配 Nemotron 3 Ultra 表现,为开发者提供了低成本、高灵活性的私有化部署方案。
YouWare 模型评测功能发布:开启 AI 应用质量评估新纪元
YouWare 正式推出其核心模型评测功能,旨在解决 AI 应用开发中模型效果难以量化与对比的痛点。该功能支持多维度指标评估,涵盖准确率、延迟及成本等关键维度,并引入自动化测试框架,帮助开发者在模型微调与部署前进行标准化验证,显著提升 AI 产品的交付质量与稳定性。
MolmoWeb 发布开源视觉网页代理:终结黑盒自动化,让 Web Agent 真正可审计
MolmoWeb 项目发布开源视觉网页代理,无需依赖 HTML 结构或私有 API 即可自主导航网页。针对当前 Web Agent 依赖闭源模型、结构脆弱及数据黑盒的痛点,MolmoWeb 提供开源模型、合成与人类轨迹混合数据集及超越 GPT-4o 的基准表现。其核心在于构建“视觉 grounding + 开放数据 + 可审查轨迹”的审计模式,推动 Web Agent 从演示走向企业级自动化部署。
GLM-5.2 正式入驻 Ajelix:1M 上下文窗口与代码能力双重飞跃
Ajelix 宣布引入 Z.ai 最新旗舰模型 GLM-5.2,该模型基于 MIT 开源协议,拥有业界领先的 100 万 token 稳定上下文窗口。相比前代 GLM-5.1,其在 Terminal-Bench 等代码与智能体基准测试中提升显著(Terminal-Bench 提升 17.5 分),专为复杂工作流、长文档分析及高级编程任务设计,旨在强化企业级 AI 自动化能力。
Label Studio 深度解析:SAM2 与 YOLO 在边界框标注中的选型指南
Label Studio 官方发布最新技术指南,深入对比 Segment Anything Model 2 (SAM2) 与 YOLO 在边界框标注场景下的核心差异。文章指出 SAM2 擅长类无关的交互式高精度分割,而 YOLO 则在固定类别的批量自动标注中占据速度优势。指南建议开发者根据业务需求选择单一模型,或采用 YOLO 初筛 + SAM2 精修的混合架构,以提升标注效率与质量。
Meshy 赋能 STEAM 教育:Hasten 希伯来学院以 AI 驱动 3D 资产创作革新课堂
Hasten 希伯来学院通过集成 Meshy AI 工具,成功解决了 K-8 学生在创建高质量 3D 资产时的技术门槛问题。该案例展示了如何利用 AI 提示工程与内置动画功能,让学生从被动消费者转变为主动创造者。Meshy 不仅加速了 VR/AR 内容的生成,还通过协作工作流将创意主导权交还给学生,并在 ISTE 等国际会议上获得展示,验证了其在下一代数字艺术家培养中的巨大潜力。
XYZ SCIENCE 发布降 AI 行业黑话指南:揭秘自研模型与壳工具的本质差异
XYZ SCIENCE 发布深度解析文章,系统拆解降 AI 行业 10 个核心术语,包括 Perplexity、Burstiness、风格指纹及多目标损失函数等。文章直击行业痛点,揭露 95% 市场被“壳工具”垄断的现状,并详细阐述 XYZ SCIENCE 基于 700 万 + 学术数据训练的自研学术模型如何通过 7 项优化目标实现 70-90% 的降 AI 降幅,彻底解决“风格收敛”与“假阳性”难题。
Nexu 发布 Matrix-Game 3.0:40 FPS 实时世界建模与长程记忆突破
Nexu 团队推出 Matrix-Game 3.0,解决了交互式世界模型在长序列生成中时空一致性与记忆丢失的核心痛点。该模型通过多段自回归蒸馏、相机感知记忆检索及自修正训练机制,实现了 720p 分辨率下 40 FPS 的实时推理。这一突破为游戏原型设计、机器人仿真及 XR 空间产品测试提供了具备持久记忆能力的生成式环境,标志着世界模型从离线渲染向实时交互应用的关键跨越。
scikit-learn 携手 Probabl 推出 Skolar:开源数据科学教育新范式
scikit-learn 项目联合其长期赞助商 Probabl 正式推出 Skolar,这是一个旨在民主化开源数据科学教育的完全开源新倡议。Skolar 基于 Inria scikit-learn MOOC 的成功经验,提供从入门到专家级的交互式课程,涵盖无监督学习、数据清洗及行业特定模块。该计划致力于通过社区共建资源,降低数据科学门槛,连接学术研究、软件工具与实战应用。