Deduct OpenAI GPT-4o's Neural Network Architecture

Tutorials

推導 OpenAI GPT-4o 的神經網路架構

OpenAI 尚未發表關於 GPT-4o 的論文,所以這段影片做了次好的事:根據 OpenAI 實際展示的能力,反向工程推導神經網路架構幾乎肯定是什麼樣子

OpenAI 尚未發表關於 GPT-4o 的論文,所以這段影片做了次好的事:根據 OpenAI 實際展示的能力,反向工程推導神經網路架構幾乎肯定是什麼樣子。起始證據相當令人驚豔——232ms 的音訊回應時間(基本上就是人類對話延遲),在單一統一模型中跨越文本、音訊、影像和視訊的聯合推理,以及比 GPT-4 Turbo 便宜 50% 的 API 定價,同時具有明顯更好的多語言文本、視覺和音訊理解。底層發生了結構性的改變,這顯然不只是 GPT-4 的微調。

分析遍歷了單一統一模型處理全模態輸入和輸出可能需要的內容:音訊如何可能繞過經典的 Whisper-plus-LLM-plus-TTS 管道(該管道在舊的 ChatGPT Voice Mode 中導致語音延遲),什麼標記化和嵌入選擇使亞秒級跨模態回應可行,以及 GPT-4o 可能從何處借鑑 OpenAI 的 Whisper、Voice Engine 和視覺研究加上相鄰工作(如 Google 的 Project Astra)。如果你正在設計多模態系統,或試圖理解為什麼 GPT-4o 的語音互動在分類上感覺完全不同於之前拼湊在一起的管道,請按播放以獲得架構推導。