AS
AI 音频语音 发布方:Assemblyai ⭐ 5 累计 29 条资讯动态

AssemblyAI 官方最新动态与版本发布资讯

转录和理解语音的AI模型

官方发布与版本更新历史记录

第 3 / 3 页 (共 29 条)
2024-07-15 模型发布 | 技术解读 | 生态合作
官方原文

AssemblyAI 深度解析 Microsoft Florence-2:通用视觉基础模型如何重塑计算机视觉

AssemblyAI 发布深度指南,详解 Microsoft Florence-2 这一通用视觉基础模型。Florence-2 借鉴 LLM 的成功范式,通过统一的 Seq2Seq Transformer 架构和 FLD-5B 超大规模数据集,实现了从图像描述到像素级分割的零样本能力。文章解析了其解决语义粒度与空间层级挑战的核心机制,并提供了 API 调用与微调策略,标志着计算机视觉进入“大模型时代”。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-05-08 产品动态 | 版本升级 | 模型发布
官方原文

AssemblyAI 发布 Best 与 Nano 双 Tier 语音转文本方案,兼顾精度与成本

AssemblyAI 正式推出 Best 与 Nano 两个语音转文本(Speech-to-Text)服务层级,旨在帮助开发者根据预算、速度和精度需求灵活选择。Best Tier 作为默认选项,提供最高精度的 Universal-1 模型,适用于复杂音频场景;Nano Tier 则以更低的成本提供高性价比服务,适合内容生成与基础索引。开发者可通过 API 参数一键切换层级,实现应用构建中的成本优化与性能平衡。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-04-23 产品动态 | 版本升级 | 技术解读 | 生态合作
官方原文

AssemblyAI 联合 Make 发布音频 PII 自动脱敏工作流教程

AssemblyAI 与自动化平台 Make 合作,发布全新集成教程,演示如何利用 AssemblyAI 的 PII 脱敏功能,结合 Make 工作流实现音频文件的自动转录与敏感信息清洗。该方案支持从 Google Drive 等存储源自动触发,生成包含脱敏文本和音频的合规文件,为构建企业级语音数据处理管道提供了零代码/低代码的最佳实践参考。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-04-23 产品动态 | 版本升级 | 生态合作
官方原文

AssemblyAI 携手 Make 发布集成应用,赋能无代码音频智能自动化

AssemblyAI 正式推出针对 Make (Integromat) 的官方应用,将先进的语音 AI 能力无缝嵌入无代码工作流。开发者可直接利用其语音识别、音频智能分析及 LLM 生成功能,实现从音频转录、PII 数据脱敏到内容摘要的全链路自动化,大幅降低构建复杂音频处理流程的技术门槛。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文
2024-04-03 模型发布 | 技术解读 | 版本升级
官方原文

AssemblyAI 发布 Universal-1:1250 万小时训练数据打造行业最强语音识别模型

AssemblyAI 正式推出其最强大的语音识别模型 Universal-1。该模型基于超过 1250 万小时的英、西、法、德四语多语言音频数据训练,在词错误率(WER)上较竞品提升 10% 以上,幻觉率降低 30%,并实现了 5 倍推理加速。Universal-1 显著提升了时间戳精度和跨语言切换能力,为开发者构建下一代语音 AI 应用提供了坚实基础。

编辑:AssemblyAI官方 / ADK编译 阅读资讯全文