• Tulu 3: Pushing Frontiers in Open Language Model Post-Training

    대규모 언어 모델의 발전은 인공지능 분야에서 혁명적인 변화를 가져왔지만, 사후 훈련 방법론에서 오픈소스와 폐쇄형 접근법 사이에는 여전히 큰 격차가 존재했습니다. 기존의 폐쇄형 모델들은 훈련 데이터와 방법론을 투명하게 공개하지 않아 연구자들의 접근을 제한했고, 오픈소스 모델들은 성능과 정교함에서 뒤처져 있었습니다. 특히 지시 따르기, 수학적 추론, 코딩과 같은 핵심 기술 영역에서 오픈소스 모델들의 성능은 상업용 모델에 비해 현저히 낮았습니다.


  • Pixtral 12B

    현대 인공지능 연구에서 멀티모달 언어 모델의 발전은 매우 중요한 과제로 대두되고 있습니다. 기존의 대부분 멀티모달 모델들은 이미지 이해 능력과 텍스트 처리 능력 사이에 심각한 성능 불균형을 보였으며, 특히 오픈소스 모델들은 상업용 클로즈드 모델들에 비해 현저히 낮은 성능을 나타냈습니다. 연구진은 이러한 한계를 극복하고, 실제 사용자 환경에서 유용하게 활용될 수 있는 멀티모달 AI 시스템의 필요성을 깊이 인식했습니다.


  • LightRAG: Simple and Fast Retrieval-Augmented Generation

    검색 증강 생성(RAG) 기술은 대규모 언어 모델이 외부 지식 소스를 활용하여 더욱 정확하고 맥락에 적합한 응답을 생성할 수 있도록 하는 중요한 기술입니다. 그러나 기존 RAG 시스템들은 두 가지 근본적인 한계를 가지고 있습니다. 첫째, 많은 방법들이 평면적 데이터 표현에 의존하고 있어 엔터티 간의 복잡한 관계를 기반으로 정보를 이해하고 검색하는 능력이 제한됩니다. 둘째, 다양한 엔터티와 그 상호 관계에 걸쳐 일관성을 유지하는 맥락 인식 능력이 부족하여, 사용자의 질의에 완전히 대응하지 못하는 단편적인 응답이 생성됩니다. 예를…


  • Gemma 2: Improving Open Language Models at a Practical Size

    대규모 언어 모델(LLM)의 발전은 최근 인공지능 분야에서 가장 주목받는 연구 영역 중 하나입니다. 기존의 대규모 모델들은 놀라운 성능을 보여주었지만, 대부분 계산 비용이 매우 높고 접근성이 제한적이었습니다. 특히 소규모 모델들의 성능 개선은 주로 훈련 길이 증가에 의존해 왔으며, 이는 데이터셋 크기에 대해 로그적으로만 확장되는 한계를 가지고 있었습니다. Chinchilla 논문에서 제시된 스케일링 법칙에 따르면, 최신 소형 모델들이 최첨단 성능을 1-2% 개선하기 위해서는 최대 15조 토큰이 필요하다는 점이 이러한 접근법의…


  • The Llama 3 Herd of Models

    대규모 언어 모델의 발전은 인공지능 분야에서 가장 중요한 연구 주제 중 하나로 자리 잡았습니다. 기존의 언어 모델들은 여러 가지 한계점을 가지고 있었는데, 특히 데이터 품질, 모델 규모, 그리고 다국어 및 다중 모달 능력에서 제한적이었습니다. Meta AI 연구팀은 이러한 한계를 극복하고 더욱 강력하고 유연한 언어 모델을 개발하고자 Llama 3 프로젝트를 시작했습니다.