Olewave의 음성 데이터 청소 파이프라인을 효과적이고 독특하게 만드는 것은 무엇인가
Olewave의 Olign 파이프라인이 원본 오디오를 프로덕션 준비 완료된 ASR/TTS 훈련 데이터로 변환하는 방법 — 검증된 트랜스크립트, 단어 수준 타임스탐프, 및 신뢰도 점수, 인간 레이블러 없음.
Olewave의 최첨단이며 매우 사용자 정의 가능한 음성 데이터 청소 파이프라인은 음성 데이터 수집 파이프라인과 원활하게 통합되어, Olewave의 음성 데이터 큐레이션 파이프라인을 형성합니다. 이 End-to-End 시스템은 정밀하게 설계되어 대규모로 높은 품질, 일관성 있고 비용 효율적인 음성 데이터셋을 제공하도록 만들어졌으며, 광범위한 다운스트림 애플리케이션에 맞춤화되었습니다. 또한, 우리는 우리의 파이프라인을 통해 큐레이션된 대규모, 비용 효율적인 음성 데이터셋을 제공하고 있으며, 여러 언어로 제공되고 다양한 주제를 다루고 있습니다.
Olewave의 최첨단이며 매우 사용자 정의 가능한 음성 데이터 청소 파이프라인 은 음성 데이터 수집 파이프라인과 원활하게 통합되어, Olewave의 음성 데이터 큐레이션 파이프라인을 형성합니다.
아래 그림은 우리의 음성 데이터 청소 파이프라인의 효율화된 workflow를 보여주고 있으며, 미처리된 비정형 음성 데이터를 정제되고 실행 가능한 데이터셋으로 변환하는 능력을 보여줍니다.
우리의 파이프라인은 여러 가지 장점을 제공합니다:
- 효과적: Whisper 및 기타 오픈 소스 솔루션과 비교하여 검증된 speaker 레이블 및 트랜스크립션, 정확한 단어 타임스탐프 및 과신하지 않는 신뢰도 점수를 생성합니다.
- 견고성: 즉흥적인 대화 음성, speaker overlap이 있는 시나리오 및 ASR 오류를 포함하는 트랜스크립션을 처리합니다.
- 확장 가능: Optional metadata를 활용하고 증가된 레이블 신뢰성을 위해 추가 modality를 통합하도록 업그레이드할 수 있습니다. 파이프라인은 또한 Olewave의 또는 클라이언트의 자체 레이블 태깅 모델 (예: emotion, semantics, …)의 plug-and-play 통합을 지원합니다.
- 효율성: 최소한의 또는 전혀 GPU 리소스가 필요하지 않으므로 빠르게 실행되고 비용 효율적입니다.
- 정확한 타이밍 정보로 단어를 정확하게 강조하여, annotators가 전체 오디오를 반복적으로 듣지 않고 중얼거린 또는 불분명한 segments를 빠르게 찾고 검토할 수 있게 합니다.
- Annotators가 중간 범위의 신뢰도 점수를 가진 단어에 집중하도록 안내하여, 모든 단어를 검토해야 할 필요성을 최소화하고 수정 프로세스를 효율화합니다.
이러한 targeted insights를 제공함으로써, 우리의 파이프라인은 효율성을 향상시키고, 수동 작업을 줄이며, 더 비용 효율적인 annotation workflow를 보장합니다.
아래는 파이프라인의 출력의 시각화된 예이며, speaker 레이블, 단어 수준 타임스탐프 및 신뢰도 점수를 보여줍니다:
그림 1. 대화는 합성 또는 prompted 음성이 아닌 실제 interactions에서 나온 것입니다. 트랜스크립트는 ASR에 의해 생성된 것이 아닌 인간이 수동으로 업로드한 것입니다. Speaker 레이블도 speaker diarization 알고리즘에서 유래한 것이 아닌 인간이 수동으로 추가한 것입니다. 첨부된 JSON 파일에는 speaker 시간 간격, 대화 트랜스크립트, 단어 수준 타임스탐프, 및 신뢰도 점수를 포함한 상세한 트랜스크립트가 포함되어 있습니다. 폰 수준 타임스탐프 및 신뢰도 점수도 요청 시 제공됩니다.
그림 2. 각 단어 아래의 값이 발음 점수를 나타내는 noisy spontaneous 음성의 postprocessing의 예이며, 이는 음성 평가와 밀접한 관련이 있습니다. 다음은 일부 단어의 점수에 대한 설명입니다: a) 단어 'together': 'togeth-'처럼 발음되었으며, 끝부분 '-er'이 제시되지 않았고, '-o-' vowel이 매우 짧은 지속시간을 가지고 있으며, 거의 없는 상태입니다. b) 시작 단어 'it': spectrogram에 fricative phone이 있지만 거의 들을 수 없습니다. 이는 단어가 누락될 가능성이 높다는 것을 의미하는 낮은 점수 0.47을 가지고 있습니다. c) 끝에 삽입된 단어 'lt': 사람이 말하지 않았습니다. 트랜스크립트가 잘못 '<' ('<' 기호는 HTML에서 사용됨)를 포함하기 때문입니다. 매우 낮은 점수 0.13은 이것이 우리의 데이터 청소 파이프라인에서 제거할 수 있는 삽입된 단어임을 나타냅니다.
학계와 산업 모두에서 대규모 End-to-End (E2E) 프레임워크 및 대규모 E2E ASR 모델이 각각 정확한 단어 수준 타임스탐프 및 신뢰할 수 있는 단어 수준 신뢰도 점수를 생성할 때 본질적인 limitations을 가지고 있다는 것이 널리 인정됩니다.
이러한 limitations를 해결하기 위해, 우리는 non-End-to-End speech-to-text alignment 기술에서 우리의 깊은 expertise를 활용하고 metadata information을 통합하는 정교한 프로세스를 개발했습니다. 이 접근 방식은 트랜스크립트에서 non-spoken content (예: filler words, background noise transcriptions)를 효과적으로 제거할 수 있게 하여, 최종 출력에서 더 높은 정확성과 신뢰성을 보장합니다.
이것은 데이터 파이프라인의 단어 수준 JSON 출력의 snippet입니다. 'speaker' 필드는 이 녹음에서 speaker의 id를 나타냅니다. 'start_time' 및 'end_time' 필드는 speaking speaker의 시간 범위를 나타내는 초 단위입니다. 'block' 필드는 같은 speaker로부터의 하나 또는 여러 개의 연속 utterances를 포함합니다. 각 utterance는 자신의 시작 시간, 종료 시간, transcript, speaker overlap indicator, 및 신뢰도 점수를 가지고 있습니다. 'overlap' 필드가 true일 때, 현재 segment가 인접한 segments와 speaker overlap을 가지고 있다는 것을 의미합니다. 신뢰도 점수는 0부터 1까지의 범위입니다.
{
"speaker": 0,
"start_time": "47.18",
"end_time": "49.83",
"block": [
{
"start_time": "47.18",
"end_time": "49.83",
"transcript": "music-related jobs compared to New York and LA.",
"overlap": false,
"word_details": [
{
"start_time": "47.18",
"end_time": "47.53",
"word": "music",
"confidence": "0.97"
},
{
"start_time": "47.53",
"end_time": "47.89",
"word": "related",
"confidence": "0.79"
},
{
"start_time": "47.89",
"end_time": "48.44",
"word": "jobs",
"confidence": "0.98"
},
{
"start_time": "48.44",
"end_time": "48.90",
"word": "compared",
"confidence": "0.96"
},
{
"start_time": "48.90",
"end_time": "48.96",
"word": "to",
"confidence": "0.17"
},
{
"start_time": "48.96",
"end_time": "49.08",
"word": "new",
"confidence": "0.97"
},
{
"start_time": "49.08",
"end_time": "49.37",
"word": "york",
"confidence": "0.98"
},
{
"start_time": "49.37",
"end_time": "49.49",
"word": "and",
"confidence": "0.92"
},
{
"start_time": "49.49",
"end_time": "49.83",
"word": "la",
"confidence": "0.56"
}
]
}
]
},
