Bits, Bytes and Neural Networks
A Data Scientist's Digital Playground
-
Llama 2: Open Foundation and Fine-Tuned Chat Models
대규모 언어 모델(LLM)의 발전으로 AI 어시스턴트가 복잡한 추론 작업을 수행할 수 있게 되었지만, 이러한 모델의 개발은 높은 컴퓨팅 요구사항으로 인해 소수의 기업에만 제한되어 있었습니다. 기존의 오픈소스 모델들은 ChatGPT와 같은 상용 모델들과 비교했을 때 성능과 안전성 측면에서 격차가 있었습니다. 메타는 이러한 격차를 해소하고 AI 기술의 민주화를 촉진하기 위해 Llama 2를 개발하고 공개하기로 결정했습니다.
-
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
대규모 언어 모델은 방대한 비지도 학습 데이터로부터 광범위한 세계 지식과 추론 능력을 습득하지만, 이러한 모델의 행동을 인간의 선호도에 맞춰 정밀하게 제어하는 것은 매우 어려운 과제입니다. 현재 표준적인 접근법인 인간 피드백 기반 강화학습(RLHF)은 먼저 인간 선호도 데이터로부터 보상 모델을 학습한 후, 강화학습 알고리즘을 사용하여 이 보상을 최대화하도록 언어 모델을 최적화합니다. 이 파이프라인은 여러 언어 모델을 동시에 훈련시켜야 하고, 훈련 루프에서 언어 모델 정책으로부터 샘플링을 수행해야 하므로 상당한 계산 비용이…
-
QLoRA: Efficient Finetuning of Quantized LLMs
대규모 언어 모델의 파인튜닝은 모델의 성능을 향상시키고 특정 작업에 적응시키는 매우 효과적인 방법이지만, 모델 규모가 수백억 개의 파라미터로 증가하면서 심각한 메모리 병목 현상이 발생했습니다. 예를 들어, LLaMA 650억 파라미터 모델을 일반적인 16비트 정밀도로 파인튜닝하려면 780GB 이상의 GPU 메모리가 필요하며, 이는 대학 연구실이나 중소 규모 기업에서는 실질적으로 접근 불가능한 수준입니다. 최근 연구들이 양자화 기법을 통해 대규모 언어 모델의 메모리 사용량을 줄일 수 있음을 보여주었지만, 이러한 기법들은 추론…
-
LLaMA: Open and Efficient Foundation Language Models
대규모 언어 모델(LLM)의 발전은 주로 비공개 데이터셋과 막대한 컴퓨팅 자원을 보유한 대기업들에 의해 주도되어 왔습니다. 이는 학계와 소규모 연구 기관들의 LLM 연구 참여를 제한하는 중요한 장벽이 되어왔습니다. 메타 AI 연구진은 이러한 한계를 극복하고자, 공개적으로 접근 가능한 데이터만을 사용하여 최고 수준의 성능을 달성할 수 있는 효율적인 언어 모델을 개발하고자 했습니다. 특히 Hoffmann의 연구에서 제시된 "더 큰 모델보다 더 많은 데이터로 학습된 작은 모델이 더 효율적일 수 있다"는 통찰을 검증하고 발전시키고자…
-
Constitutional AI: Harmlessness from AI Feedback
AI 시스템의 능력이 인간 수준에 도달하거나 이를 초과하는 상황에서 이들을 유용하고, 정직하며, 무해한 상태로 유지하는 것은 AI 안전성 연구의 핵심 과제입니다. 기존의 인간 피드백으로부터의 강화 학습(RLHF) 방법은 수만 개의 인간 레이블을 필요로 하며, 이는 상당한 비용과 시간을 소모합니다. 더욱이 이전 연구에서는 무해성과 유용성 사이에 심각한 긴장이 존재함을 발견했는데, 특히 모델이 논란의 여지가 있는 질문에 대해 회피적으로 응답하는 경향이 있었습니다. 이러한 회피성은 크라우드워커들이 유해한 입력에 대한 응답으로 회피성을…