Tutorials
[長評] 微調語言模型是零次學習器
在 InstructGPT 使指令調優成為家喻戶曉的術語之前,Google 的 FLAN 論文表明,對自然語言指令進行適度的多任務微調可以將一個普通的 LM 轉變為令人驚訝的強大
Tutorials
[長評] 'GShard':使用條件計算和自動分片擴展巨型模型
將 Transformer 擴展到超過一千億個參數很快會變成哲學問題:你是為每個令牌激活整個網絡,還是將每個令牌路由到真正需要查看它的專家?
