OpenAI GPT-4o의 신경망 아키텍처 추론하기
OpenAI는 GPT-4o에 대한 논문을 발표하지 않았으므로, 이 영상은 다음 최선의 방법을 제시합니다: OpenAI가 실제로 시연한 기능을 바탕으로 신경망 아키텍처가 거의 확실히 어떤 모습인지를 역엔지니어링합니다
OpenAI는 GPT-4o에 대한 논문을 발표하지 않았으므로, 이 영상은 다음 최선의 방법을 제시합니다: OpenAI가 실제로 시연한 기능을 바탕으로 신경망 아키텍처가 거의 확실히 어떤 모습인지를 역엔지니어링합니다. 초기 증거는 놀랍습니다 — 232ms 오디오 응답 시간(기본적으로 인간 수준의 대화 지연 시간), 단일 통합 모델에서 텍스트, 오디오, 이미지 및 비디오 전체에 걸친 결합 추론, 그리고 GPT-4 Turbo보다 50% 저렴한 API 가격(의미 있게 더 나은 다국어 텍스트, 비전 및 오디오 이해 포함). 무언가 구조적 변화가 내부에서 발생했으며, 명확하게 GPT-4의 단순한 미세 조정은 아닙니다.
분석은 옴니모달 입출력을 처리하는 단일 통합 모델이 그럴듯하게 요구하는 것을 살펴봅니다: 오디오가 구형 ChatGPT Voice Mode에서 음성 지연을 유발한 전형적인 Whisper-plus-LLM-plus-TTS 파이프라인을 어떻게 우회할 가능성이 높은지, 어떤 토큰화 및 임베딩 선택이 1초 미만의 크로스모달 응답을 가능하게 하는지, 그리고 GPT-4o가 OpenAI의 Whisper, Voice Engine 및 비전 연구와 Google의 Project Astra와 같은 인접 작업에서 어떻게 차용할 가능성이 높은지. 멀티모달 시스템을 설계하거나 GPT-4o의 음성 상호작용이 이전의 이음매 있는 파이프라인과 범주적으로 다른 이유를 이해하려고 한다면, 아키텍처 추론을 보려면 재생을 누르십시오.
