Claude 3이 GPT-4를 능가하게 만든 비결
Claude 3 Opus가 MMLU, GPQA, GSM8K 및 대부분의 경계 평가 벤치마크에서 GPT-4를 능가했을 때, 흥미로운 질문은 Anthropic이 단순히 더 크게 확장했는지 여부가 아니라 어떤 학습 시간 비결이었는지였습니다.
Claude 3 Opus가 MMLU, GPQA, GSM8K 및 대부분의 경계 평가 벤치마크에서 GPT-4를 능가했을 때, 흥미로운 질문은 Anthropic이 단순히 더 크게 확장했는지 여부가 아니라 어떤 학습 시간 비결이 실제로 그들을 거기에 이르게 했는지였습니다. 이 리뷰는 Opus, Sonnet 및 Haiku를 다루는 Claude 3 기술 보고서를 분석하고 더 중요하게는 Anthropic의 정렬 스택 뒤의 핵심 알고리즘을 파고듭니다: Constitutional AI와 이를 구동하는 RLAIF 학습 루프.
이 과정은 Claude 3을 세 가지 능력 계층에서 작동시키는 것, 왜 이 패밀리가 단일 플래그십 모델보다는 의도적으로 지능-속도-비용 트레이드오프 중심으로 설계되었는지, 그리고 RLAIF — 작성된 헌법으로 안내되는 AI 피드백으로부터의 강화 학습 — 이 인간 라벨러에 의존하는 순수 RLHF의 일부 확장 병목을 어떻게 우회하는지를 다룹니다. 헌법 접근법이 다르게 확장되는 이유, 분석, 예측, 코드 생성 및 비영어의 개선을 어떻게 주도하는지, 그리고 유사하게 정렬된 모델을 구축하려는 모든 사람에게 무엇을 의미하는지에 대한 더 명확한 그림을 얻을 것으로 예상됩니다. 벤치마크 차트를 넘어서 경계 LLM 경쟁을 추적하고 있다면, 이는 확실한 5분입니다.
