Olewave at ICASSP 2024

Events

ICASSP 2024에서의 Olewave

우리는 서울의 IEEE ICASSP 2024의 후원사이자 전시업체였으며, 당사의 설립자이자 CEO인 Wei Chu가 야생 웹 소싱 데이터로부터 음성 모델 훈련에 대한 초대 연설을 진행했습니다.

Olewave at ICASSP 2024

Olewave는 Meta, Google, Samsung, Apple, ByteDance, Adobe, MathWorks 및 기타 다수와 함께 서울의 IEEE ICASSP 2024의 후원사이자 전시업체였습니다. 전체 후원사 목록 보기 →

부스에 들러 음성, 데이터 및 음성 AI에 대해 이야기해 주신 모든 분들께 감사드립니다.

당사 설립자 및 CEO의 초대 연설

Olewave의 설립자이자 CEO인 Wei Chu는 컨퍼런스 중에 초대 연설을 진행했습니다:

맞춤형 음성 관련 서비스의 비용 효율적인 개발을 위한 야생 및 방치된 데이터 활용

초록 최근 웹에서 수집한 대규모 음성 데이터셋으로 훈련된 모델이 전통적인 인간 레이블 또는 시뮬레이션 음성 데이터셋보다 더 높은 정확도를 달성하고 잠재적으로 더 낮은 비용으로 달성할 수 있음을 발견했습니다. 우리는 사용자 정의 가능한 AI 기반 데이터 레이블링 시스템을 개발했습니다. 이는 신뢰도 점수가 있는 단어 수준 전사를 추론하여 감독 ASR 훈련을 가능하게 합니다. 또한 전사 또는 인식 오류가 있을 때 전화 수준 타임스탬프를 견고하게 생성하여 TTS 모델 훈련을 용이하게 합니다. 또한 시나리오, 악센트, 언어 및 주제 태그와 같은 레이블을 자동으로 할당하여 작업별 데이터 선택을 가능하게 합니다.

우리는 WhisperSeamlessM4T와 같은 오픈소스 대형 음성 모델을 미세 조정하고 결과 메트릭을 분석하여 데이터셋의 효율성을 평가했습니다. 공개적으로 사용 가능한 데이터 외에도, 우리의 데이터 처리 시스템은 특정 수직 도메인에서 독점 데이터에 대한 신뢰할 수 있는 레이블을 제공하기 위해 맞춤 설정할 수 있습니다 — 인간 레이블러 없이 도메인별 모델의 감독 훈련을 활성화하고, 데이터 침해 위험을 제거하며, 레이블링 비용을 크게 줄입니다.

ICASSP 2024 사이트의 연설 세부 사항 보기 →

당사가 선보인 것

음성 데이터셋

  • 대규모 — 수백만 시간까지
  • 실제 시나리오 — 회의, 통화, 토크, 자연 대화
  • 단어 및 발언 수준 신뢰도가 있는 검증된 축어 전사
  • 다중 언어 및 다중 지역 — 적극적으로 브라질 포르투갈어, 라틴 아메리카 스페인어, 아랍어, 동남아시아 언어, 중국어, 일본어 및 한국어 수집
  • 다양한 주제 — 패션, 엔터테인먼트, 의료 등

ASR 외에도, 우리는 회의 요약, 음성 합성 및 음성 복제, 및 자신의 모델을 벤치마킹하기 위한 평가 전용 세트를 위한 코퍼스를 생성합니다. 우리는 현실적인 음성 및 토킹 헤드 합성을 위해 고충실도 오디오/비디오를 제공합니다.

독점 데이터 레이블링을 위한 맞춤형 솔루션

당사의 4단계 파이프라인을 사용하면 민감한 데이터를 인간 레이블러에게 노출시키지 않고 레이블을 지정할 수 있습니다:

  1. 빠른 시작 — 클라이언트 도메인과 일치하는 도메인에서 야생 데이터에서 도메인 모델을 미세 조정하고, 대형 음성/언어 기반 모델부터 시작합니다.
  2. 자동 레이블 — 도메인 모델은 신뢰도 점수로 클라이언트의 독점 데이터에 레이블을 지정합니다. 인간 레이블러는 필요하지 않습니다. 데이터 침해 위험이 없습니다.
  3. 반복적으로 학습 — 레이블이 지정된 비공개 및 공개 데이터의 집합을 결합하여 모델을 개선한 다음 개선된 버전으로 비공개 데이터를 다시 레이블합니다.
  4. 준비 완료 — 품질이 안정화되면, 우리는 당사의 Tycho SDK를 라이센싱하여 당신이 자신의 인프라에서 계속 레이블을 지정하고 구축할 수 있도록 합니다.

Tycho — 자체 음성 서비스를 위한 우리의 SDK

Tycho는 우리가 높은 ROI의 자체 음성 제품을 구축하는 팀을 위해 ICASSP에서 전시한 SDK입니다.

  • 항상 최고 수준의 모델 정확도 및 추론 속도
  • 훈련, 미세 조정, 평가 및 배포 지원
  • 사용 가능한 모델: 온라인/오프라인 ASR, 음성 평가, 음성 복제 — 요청 시 새로운 모델 사용 가능
  • 일반적인 GPU 워크스테이션에서 실행되어 비용을 낮게 유지
  • 모든 훈련, 미세 조정, 평가 및 배포 코드는 클라이언트에게 제공됩니다

다음을 위한 경쟁력 있는 서비스 요금:

  • 최고 품질로 수직 도메인 모델 미세 조정
  • 심층 불량 사례 분석을 통해 출시된 서비스 수정 및 개선
  • 음성 R&D 프로젝트에 대한 ML 엔지니어를 위한 실무 교육

Tycho는 오픈소스가 아닙니다. 라이센싱 견적 및 서비스 요금을 문의하세요.

다음에 우리를 찾아주세요

서울에서 놓치신 분들을 위해, 올해 후반부에 더 많은 컨퍼런스에 참석할 예정입니다. [email protected]으로 이메일을 보내거나 웹사이트를 통해 연락하세요 — 데이터셋, 맞춤 모델 또는 컨설팅, 우리는 하루 업무 내에 응답하겠습니다.