Harnessing Wild Data for High-ROI Speech R&D — Our ICASSP 2024 Spotlight

Events

높은 ROI를 위한 야생 데이터 활용 음성 R&D — 당사의 ICASSP 2024 초대 연설

당사 설립자이자 CEO인 Wei Chu의 ICASSP 2024 초대 연설 — 기존 음성 서비스 구축이 낮은 ROI인 이유와 야생 데이터 필터링 + 대형 오픈소스 음성 모델로 비공개 데이터 자동 레이블링이 방정식을 어떻게 뒤집는지에 대해

Harnessing Wild Data for High-ROI Speech R&D — Our ICASSP 2024 Spotlight

서울의 IEEE ICASSP 2024에서, 당사 설립자이자 CEO인 Wei Chu는 엔터프라이즈 음성 R&D를 극적으로 저렴하게 만드는 변화에 대한 초대 연설을 진행했습니다: 인간 레이블링 및 오프더셀프 데이터셋에 대한 지불을 중단하고, 야생 데이터 및 오픈소스 기초 모델 활용을 시작하세요.

ICASSP 2024 프로그램에서 연설 보기 →

기존 음성 서비스 구축이 낮은 ROI인 이유

음성 AI를 구축하는 모든 엔터프라이즈는 동일한 3가지 유혹적인 지름길에 직면합니다. 각각 숨겨진 ROI 한계가 있습니다:

클라우드 API 호출 프로토타입 제작이 빠르고, R&D 비용이 매우 적습니다. 하지만 제품에 맞춤화할 수 없고, 특정 데이터에 대한 성능이 만족스럽지 않으며, 규모가 커지면 비용이 많이 들고, 모든 요청은 잠재적인 데이터 침해 벡터입니다.

벤더에서 구매 DIY보다 종이상 더 저렴합니다. 실제로: 데이터 + 시스템 벤더로부터의 큰 청구서, 회사 간 통신 오버헤드로 인한 차선의 성능, 그리고 여전히 데이터 침해 위험이 있습니다.

기술 거인처럼 DIY (Alexa, Siri, Google Voice Search) 자체 스택, 완전한 데이터 안전 — 배송하기 전에 R&D 팀, 데이터 큐레이션 및 인프라에 5년, 수천만 달러의 투자.

다른 "저렴한" 대안들은 더 좋지 않습니다. 해외 계약 팀, 오프더셀프 시뮬레이션 데이터셋 또는 어려움을 겪고 있는 스타트업 인수 모두 현금을 절약하기 위해 ROI를 희생합니다.

높은 ROI 대안 — 대형 음성 모델의 어깨에 서기

Olewave의 접근 방식을 지원하는 2가지 변화:

스케일링 법칙을 따르세요. 2022년 이후로, 기술 거인들은 CC-BY 대형 음성 모델을 오픈소싱했습니다 — Whisper, SeamlessM4T 등. 바퀴를 다시 발명할 필요가 없습니다. 기초 모델을 미세 조정하여 처음부터 훈련하는 대신 틈새 시장으로 이동하세요. 이렇게 하면 대부분의 R&D 팀, 데이터 큐레이션 및 훈련 인프라 지출이 제거됩니다.

야생 데이터를 필터링하고 비공개 데이터를 자동 레이블링합니다. 필터링된 야생 데이터 — AI 기반 레이블링 시스템에서 생성한 검증된 전사, 타임스탬프 및 주제 태그 — 도메인 모델을 미세 조정하는 데 사용됩니다. 그런 다음 도메인 모델은 신뢰도 점수로 독점 데이터에 레이블을 지정합니다. 인간 레이블러 없음. 데이터가 인프라를 떠나지 않습니다. 침해 위험이 없습니다. 그리고 사전 시뮬레이션된 데이터셋에 대한 청구서가 없습니다.

당사의 4단계 맞춤형 레이블링 파이프라인

  1. 빠른 시작 — 클라이언트의 도메인과 동일한 도메인에서 야생 데이터를 선택하고, 대형 음성/언어 기초 모델에서 도메인 모델을 미세 조정합니다.
  2. 자동 레이블 — 도메인 모델은 단어별 및 발언별 신뢰도 점수로 클라이언트의 독점 데이터에 레이블을 지정합니다. 인간 레이블러는 필요하지 않습니다 — 따라서 데이터 침해 위험도 없습니다.
  3. 반복적으로 학습 — 레이블이 지정된 비공개 및 공개 데이터의 집합을 컴파일하고, 도메인 모델을 다시 미세 조정한 다음, 개선된 모델로 비공개 데이터를 다시 레이블합니다. 품질이 안정화될 때까지 반복하세요.
  4. 준비 완료 — 품질이 충분할 때 반복을 중단합니다. 우리는 당신이 자신의 인프라에서 계속 레이블을 지정하고 구축할 수 있도록 우리의 Tycho SDK를 라이센싱합니다.

이것이 중요한 이유

  • 인간 레이블러 없이 도메인별 모델의 감독 훈련 — 엔터프라이즈 음성 프로젝트에서 가장 큰 반복 비용.
  • 데이터 침해 위험 없음 — 비공개 데이터는 환경을 떠나지 않습니다.
  • 크게 낮아진 레이블링 비용 — 모델이 작업을 수행하고 인간은 edge case를 검토합니다.
  • 동일한 미세 조정 워크플로우는 확장되어 제품이 성숙해질 때 새로운 도메인, 언어 및 사용 사례로 이동합니다.

당사와 대화하세요

음성 AI 제품을 위해 구축 대 구매를 평가하거나 기존 제품의 데이터 레이블링 지출을 줄이려고 한다면, 의견을 비교하고 싶습니다.

[email protected]으로 이메일을 보내거나 웹사이트를 통해 연락하세요 — 우리는 하루 업무 내에 응답하겠습니다.