Scikit-learn 发布 Metadata Routing 功能:实现跨库元数据路由与复杂工作流支持
Scikit-learn 正式宣布 Metadata Routing 功能成熟,支持在 Pipeline 中跨组件传递元数据(如 sample_weight, groups)。该更新解决了嵌套元估计器中元数据无法透传的问题,显著提升了与 fairlearn、skorch 等第三方库的互操作性,使开发者能构建更公平、无数据泄露的复杂机器学习工作流。
Python机器学习库
Scikit-learn 正式宣布 Metadata Routing 功能成熟,支持在 Pipeline 中跨组件传递元数据(如 sample_weight, groups)。该更新解决了嵌套元估计器中元数据无法透传的问题,显著提升了与 fairlearn、skorch 等第三方库的互操作性,使开发者能构建更公平、无数据泄露的复杂机器学习工作流。
Scikit-learn 1.9 正式发布,带来三大核心突破:新增实验性 Callback 机制以支持进度追踪与早停;全面强化数值稳定性,原生支持缺失值处理及 GPU 加速;优化稀疏矩阵与内存管理。此次更新显著提升了模型训练的可观测性与计算效率,为复杂场景下的机器学习应用提供了更稳健的底层支持。
scikit-learn 正式宣布全面采纳 Python Array API 标准,彻底解决长期存在的 GPU 支持难题。通过内建 vendor 库与混合设备处理能力,该工具现已原生支持 PyTorch、CuPy 等后端,并允许特征(X)与标签(y)在不同硬件(CPU/GPU)间无缝流转。此次更新标志着机器学习工作流从单一 NumPy 环境向异构计算架构的重大跨越,极大提升了大规模训练与推理的灵活性。
scikit-learn 正式推出版本 1.8,依托 Wellcome Trust 资助的 Chan Zuckerberg Initiative (CZI) 项目,大幅增强模型交互检查能力。新版本在 1.7 的基础上,为 HTML 可视化增加了参数文档链接、工具提示预览及完整参数名复制功能。这些改进显著降低了用户在 Jupyter Notebook 中调试和评估预测模型的门槛,标志着开源机器学习库在开发者体验 (UX) 领域的重大突破。
scikit-learn 项目联合其长期赞助商 Probabl 正式推出 Skolar,这是一个旨在民主化开源数据科学教育的完全开源新倡议。Skolar 基于 Inria scikit-learn MOOC 的成功经验,提供从入门到专家级的交互式课程,涵盖无监督学习、数据清洗及行业特定模块。该计划致力于通过社区共建资源,降低数据科学门槛,连接学术研究、软件工具与实战应用。
scikit-learn 官方宣布重构开发者 API,旨在解决第三方开发者依赖内部私有 API 导致的兼容性问题。新版本在公共 API 的严格向后兼容与内部 API 的高频变动之间,建立了一个新的稳定中间层。此次更新重点优化了测试基础设施,引入了更清晰的标签系统(Tags)和测试跳过机制,并发布了 `sklearn_compat` 包以辅助多版本适配。
scikit-learn 官方宣布启动全球用户调研,旨在深入了解开发者与数据科学家的使用痛点及核心需求。本次调研历时 15 分钟,支持 7 种语言,强调匿名性与数据隐私。调研结果将直接指导未来版本迭代,由 probabl、牛津大学及 POSSEE 等团队联合设计。这标志着 scikit-learn 从单向开发转向社区驱动的协作模式,为构建更强大的机器学习基础设施奠定基础。
scikit-learn 团队宣布将逐步统一代码库中的作者署名格式,从传统的个人列表改为统一的'The scikit-learn developers'。此次更新旨在解决历史遗留的作者信息滞后、贡献者权益不公等问题,并鼓励开发者使用 Git 工具进行代码溯源。