Meta的Movie Gen與OpenAI的Sora:詳細評測
Meta最終對Sora出牌,Movie Gen不僅僅是一個影片生成器——它是一批基礎模型,可跨多個長寬比產生1080p高清影片,具有同步音訊,支援精確
推導 OpenAI GPT-4o 的神經網路架構
OpenAI 尚未發表關於 GPT-4o 的論文,所以這段影片做了次好的事:根據 OpenAI 實際展示的能力,反向工程推導神經網路架構幾乎肯定是什麼樣子
Google 的通用語音模型在 100+ 語言上擊敗 OpenAI 的 Whisper 模型
Google 的通用語音模型悄悄做了一件非凡的事:在 100+ 語言上的 ASR 方面與 OpenAI 的 Whisper 相當或超越,同時使用大約七分之一的標記訓練資料。
揭露OpenAI GPT-4的視覺+文本模型、數據和訓練成本(推測)
OpenAI以拒絕披露GPT-4的架構、參數計數、訓練數據或計算預算而聞名,這使該技術報告成為ML社區的羅夏測試。
OpenAI的GPT-3深度評論:語言模型是少樣本學習者(第3/3部分:結果和其他)
這個三部分GPT-3深度探討的最終部分達到了回報:當您向基準套件投入1750億個參數並完全跳過微調時,實際會發生什麼。
[10 分鐘] 解釋為什麼 OpenAI 的 Whisper API 不如 ChatGPT
Whisper 橫空出世,但它沒有像 GPT-3 改造 NLP 那樣重塑 ASR,這份十分鐘的評論認為原因都在論文本身。
OpenAI GPT-3 的深度評論:語言模型是小樣本學習者(第 1/3 部分:介紹與方法)
這份三部分 GPT-3 評論的開篇為那篇將規模從研究賭注變成行業聖經的論文奠定了基礎。
ChatGPT/ChatGPT Plus/InstructGPT:使用人類反饋訓練語言模型來遵循指令
在 ChatGPT 產品背後是 InstructGPT 論文,這篇詳細評測拆解了將原始 GPT-3 轉變為人們真正想要對話的東西的管道。
三分鐘內解釋 ChatGPT/ChatGPT Plus 如何運作
ChatGPT 從外面看起來像魔法,但其配方是有據可查的(如果你知道去哪裡找的話),這個三分鐘的講解器濃縮了核心思想。
[Olewave 評測] CLIP (3/3): 從自然語言監督學習可轉移的視覺模型
這份 CLIP 評測的最後部分著重於結果部分,這正是 OpenAI 的對比式影像-文字模型從一個有趣的想法轉變為整個多模態堆疊基礎層原始構件的地方。
[Olewave 評測] CLIP (2/3): 從自然語言監督學習可轉移的視覺模型
OpenAI 的 CLIP 通過拋棄固定標籤集並改為在從網際網路上抓取的 4 億個(影像、文字)配對上進行訓練,翻轉了計算機視覺的劇本。
[Olewave 評測] CLIP (1/3): 從自然語言監督學習可轉移的視覺模型
在有 BLIP、LLaVA 或任何值得一提的 speech-LLM 之前,有 CLIP,這正是故事開始的地方。
[Olewave的評論] OpenAI的Whisper ASR:通過大規模弱監督進行強大的語音識別
當OpenAI推出Whisper時,ASR社區不得不面對一個在680,000小時多語言、多任務、網絡爬取音頻上訓練的系統,該系統開箱即用,跨越口音、背景噪音和技術
[長篇評論] Cascaded Diffusion Models for High Fidelity Image Generation
在Imagen和DALL-E 2將擴散設定為生成式影像的預設之前,這篇Google Brain論文奠定了Cascaded Diffusion的方案,許多後來的文字轉圖像系統都悄悄地採用:從一個小
[短篇評論] Cascaded Diffusion Models for High Fidelity Image Generation
Cascaded Diffusion是許多現代生成工作背後的二階以上方案:用一個擴散模型生成小影像,然後交給超解析度擴散模型來添加高頻細
