我们荣幸提供

Olewave OTS语音数据集

高质量,
美国透明度,
无与伦比的规模和成本效益。
  • 第一层 — 未转录:语言和话题标签(加上可选的SNR、语音比率、摘要)。

  • 第二层 — 伪转录:第一层标签+带有单词和话语级时间戳和置信度分数的机器转录。

  • 第三层 — HITL转录:第一层标签+人工制作的转录,符合第二层标准。

  • 第四层 — 高级标注:最全面—第三层+发言人转换、说话人分离、话题和自定义注解。

  • 企业就绪和成本效益:铁血SLA · AB 2013合规 · 端到端审计追踪 · 比传统数据集便宜10倍

索要目录

语音数据处理和清理服务API

将您的原始音频
转换为用于训练和评估的生产就绪数据,
使用我们的OTS级管道。
  • 清理:删除噪声、静音、重复项和无关段落

  • 注解:自定义模型生成准确的一次性标签,然后人工审核人员验证并优化为生产级质量

  • 验证:我们的专有验证捕获注解错误

  • 策划:我们甚至可以从您指定的来源收集

  • 安全:通过限制人工参与来最小化数据泄露风险

  • 交付:您的数据、您的格式、在您的基础设施上

预订免费咨询

开源对话语音数据集

OleSpeech-IV-2025-EN-AR-100
英语对话音频,
经验证的转录和发言人转换,
免费用于研究。
  • 来源:播客、谈话节目、电话会议、自然对话

  • 转录验证:单词级置信度分数,无幻觉

  • 转录更正:命名实体的专有方法—名称、组织、位置、时间

  • 细粒度计时:带有发言人转换的单词和电话级时间戳

  • 360°注解:发言人姓名、转换、SNR、话题、描述

  • 标签自定义:从预标签中选择或请求新标签

  • 生命周期策划:持续标签优化,无额外成本

  • 由Olign生产:我们的专有语音到文本对齐引擎

  • 完整数据集可购买:联系我们获取商业许可

在Hugging Face上查看

‡仅限美国公司和机构。需要签署NDA。