야마 무료

-

Llama는 Meta에서 출시한 오픈 소스 대형 언어 모델 시리즈입니다. 현재 가장 널리 사용되는 개방형 가중치 입니다. Llama 3.1은 8B/70B/405B의 세 가지 매개변수 크기를 제공하고 128K 토큰 컨텍스트와 8개 언어를 지원합니다. Meta Llama 라이선스(7억 MAU 미만 무료)에 따라 상업적 목적으로 사용할 수 있으며 HuggingFace에서 3억 번 이상 다운로드되었습니다.

야마 제품 인터페이스

Llama — 메타 오픈 소스 대규모 언어 모델 시리즈

핵심 매개변수 및 통계

매개변수 세부정보
최신 주요 버전 Llama 3.3 70B / Llama 3.2(비주얼 버전 포함) / Llama 3.1 405B
매개변수 배율 옵션 1B, 3B, 8B, 11B(시각적), 70B, 90B(시각적), 405B
최대 컨텍스트 창 128K 토큰(Llama 3.1/3.2 시리즈)
다국어 지원 8개 언어(영어, 중국어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 인도어)
라이센스 메타 라마 라이선스(<7억 MAU, 상업용 무료, 7억 MAU 이상 신청 필수)
출시 채널 HuggingFace, llama.meta.com, 주요 클라우드 서비스 제공업체
HuggingFace 다운로드 3억회 이상(2024년 누적)
변형 모델 코드 라마(코드), 라마 가드(보안 필터링), 라마 3.2 비전
양자화 지원 GGUF(llama.cpp), GPTQ, AWQ 및 기타 양자화 형식
추론 프레임워크 llama.cpp, vLLM, HuggingFace Transformers, Ollama 등

Llama 시리즈는 오픈 소스 AI의 민주화를 이끄는 가장 중요한 힘 중 하나입니다. Meta는 사전 훈련된 대규모 모델 가중치를 개방함으로써 글로벌 개발자가 API 호출에 의존하지 않고 자체 하드웨어에서 로컬로 경쟁이 치열한 대형 언어 모델을 실행, 미세 조정 및 배포할 수 있도록 하여 AI 애플리케이션의 개발 환경을 근본적으로 변화시킵니다.

사용자 및 시장 인지도

Llama 시리즈는 현재 가장 많이 다운로드되고 널리 사용되는 오픈 소스 LLM 제품군입니다. HuggingFace에서 3억 번 이상 다운로드되었으며 진정한 "오픈 소스 AI 인프라"입니다. Llama 2에서 Llama 3까지의 출시 리듬은 오픈 소스 LLM 분야에 대한 Meta의 지속적인 투자를 입증합니다. 새로운 버전이 출시될 때마다 기술 커뮤니티에서 광범위한 벤치마킹 토론과 애플리케이션 실무 공유가 시작됩니다.

상업용 애플리케이션 측면에서 Llama 시리즈는 기업이 프라이빗 AI 시스템을 구축하는 데 선호되는 오픈 소스 기본 모델 중 하나입니다. 특히 엄격한 데이터 개인 정보 보호 요구 사항이 있는 금융, 의료 및 정부 기관에서 선호합니다. 개방형이란 완전히 오프라인으로 배포할 수 있고 데이터가 기업 인트라넷을 벗어나지 않는다는 것을 의미합니다. AI 개발 커뮤니티에서는 Llama를 중심으로 수량화 도구(llama.cpp), 미세 조정 프레임워크(Axolotl, LLaMA-Factory), 대화형 인터페이스(Open WebUI) 및 추론 엔진(vLLM, Ollama)을 포함하여 매우 풍부한 생태계가 형성되었습니다. 이러한 생태학적 긍정적 피드백은 라마의 지배적 위치를 더욱 강화합니다.

비용 이점

방법 가격 주요 적용 시나리오 특징
로컬 배포(llama.cpp) 하드웨어 비용(일회성) 개인, 연구, 개인 정보 보호 애플리케이션 완전 무료, 데이터가 해당 지역을 벗어나지 않습니다
클라우드 추론(함께하는 AI) $0.20/백만개 토큰(8B) AI 애플리케이션에 대한 빠른 액세스 종량제 청구, 하드웨어 관리 필요 없음
클라우드 추론(Groq) $0.05/백만개 토큰(8B) 낮은 대기 시간 및 높은 빈도의 통화 실시간 애플리케이션에 적합한 초저지연
자체 호스팅(vLLM + GPU) GPU 하드웨어/클라우드 비용 엔터프라이즈의 동시성 프로덕션 배포 최대의 유연성, 완전히 사용자 정의 가능

GPT-4 Turbo(10만 달러/100만 달러)와 비교: Llama 3.1 70B는 여러 벤치마크 테스트에서 유사하거나 동등한 성능을 발휘하는 반면 Together AI를 통한 호출 비용은 100만 달러/100만 토큰에 불과하며 가격이 약 90% 저렴합니다. 로컬 배포에는 일회성 하드웨어 투자만 필요하며 지속적인 API 비용은 필요하지 않습니다.

주요 기능

  • Llama 3.1 8B/70B/405B 다중 확장 옵션: 경량 8B(소비자급 GPU에서 실행 가능)부터 플래그십 405B(GPT-4o에 대해 벤치마킹된 종합 성능)까지 다양한 컴퓨팅 전력 예산 및 성능 요구 사항을 충족하므로 사용자는 시나리오에 따라 최적의 비용 효율적인 확장을 선택할 수 있습니다.
  • 128K 토큰 긴 컨텍스트 처리: Llama 3.1 시리즈는 컨텍스트 창을 128K 토큰으로 확장하여 매우 긴 문서 처리, 코드 기반 분석 및 여러 라운드의 심층 대화를 지원함으로써 Llama가 이전에 소수의 LLM만 지원했던 긴 컨텍스트 애플리케이션 시장에 진입할 수 있게 해줍니다.
  • 다국어 기능(8개 언어): Llama 3.1은 기본적으로 영어 외에 중국어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 힌디어를 지원하므로 번역 중간 계층 없이도 다국어 대화 및 텍스트 처리가 가능합니다.
  • 코드 라마(코드별 변형): 코드 이해, 생성 및 디버깅 작업에 최적화된 라마 변형입니다. Python, Java, C++, TypeScript 등과 같은 여러 주류 프로그래밍 언어를 지원하며 오픈 소스 코드 대규모 모델에 중요한 선택입니다.
  • Llama Guard(보안 필터링 모델): Llama 아키텍처를 기반으로 훈련된 콘텐츠 보안 분류 모델입니다. AI 대화에서 유해한 콘텐츠를 감지하고 필터링하는 데 사용되어 개발자가 보안 표준을 준수하는 AI 애플리케이션을 구축하는 데 도움이 됩니다. 독립적인 구성요소로 통합될 수 있습니다.
  • Llama 3.2 Vision(다중 모드 버전): 이미지 이해를 지원하고 이미지와 텍스트의 혼합 입력을 처리할 수 있으며 이미지 설명, 시각적 질문 답변, 문서 이미지 이해와 같은 시각적 작업을 수행할 수 있는 다중 모드 Llama 변형(11B 및 90B)입니다.
  • 개방형 가중치 미세 조정 가능: 전체 모델 가중치를 다운로드할 수 있으며, 자체 데이터에 대한 전체 매개변수 미세 조정(Full Fine-tuning) 또는 매개변수 효율적인 미세 조정(LoRA, QLoRA)을 지원하고 도메인 지식을 모델에 주입하여 독점적인 산업 모델을 생성할 수 있습니다.
  • 양자화 버전 지원(저전력 장치): 7B/8B 양자화 모델은 Apple Silicon Mac(예: M2 MacBook Pro) 또는 GGUF 양자화 형식(llama.cpp)을 통해 소비자 GPU에서 허용 가능한 속도로 실행될 수 있습니다.

Llama를 실행할 수 있는 하드웨어 범위가 크게 확장되었습니다.

모델 및 버전의 진화

버전 출시일 설명
라마 1(7B/13B/33B/65B) 2023-02 첫 번째 라마 시리즈는 연구용으로만 사용되며 상업적인 사용은 허용되지 않습니다
라마 2(7B/13B/34B/70B) 2023-07-18 상용 라이선스 최초 오픈, 채팅 대화 최적화 버전 출시, 마일스톤 출시
코드 라마 2023-08-24 코드 완성 및 생성을 지원하는 Llama 2 기반의 코드별 모델
라마 2 롱 2023-09 긴 문서 시나리오에 맞게 Llama 2 컨텍스트를 32K로 확장
라마 3(8B/70B) 2024-04-18 전체 성능이 크게 향상되어 8K 컨텍스트가 동일 매개변수 스케일로 Gemma/Mistral 모델을 능가합니다
라마 3.1(8B/70B/405B) 2024-07-23 플래그십 버전, 128K 컨텍스트, 405B 벤치마크 GPT-4o, 다국어 지원, 완전 상용
라마 3.2(1B/3B/11B/90B) 2024-09-25 경량 1B/3B 엔드측 모델 및 11B/90B 시각적 언어 모델 추가
라마 3.3 70B ~2024-12 70B 성능은 가장 비용 효율적인 오픈 소스 교육 모델인 405B 수준에 가깝게 크게 향상되었습니다.

기술적인 장점

개방형 가중치가 제공하는 배포 유연성: Llama의 핵심 가치는 "개방형 가중치"에 있습니다. API 호출을 제공하는 비공개 소스 모델과 달리 Llama를 사용하면 호출 수에 제한이 없고 데이터 전송 위험이나 API 종속성 위험 없이 전체 모델 파일을 다운로드하여 모든 하드웨어에서 실행할 수 있습니다. 이 기능은 데이터 보안에 민감한 기업에 특히 중요하며 완전히 자율적이고 제어 가능한 AI 시스템을 구축하기 위한 기술 기반입니다.

강력한 오픈 소스 생태계: 현재 오픈 소스 LLM 생태계에서 가장 완벽한 도구 체인은 Llama를 중심으로 형성되었습니다. llama.cpp는 소비자급 하드웨어에서 로컬 추론을 위해 vLLM을 구현하고, 프로덕션 등급의 높은 처리량 추론을 구현하며, Ollama는 원클릭 로컬 배포 경험을 제공하고, LLaMA-Factory 및 Axolotl은 편리한 미세 조정 도구를 제공하며, Open WebUI는 아름다운 대화형 인터페이스를 제공합니다. 이러한 생태학적 긍정적 피드백 루프를 통해 Llama의 유용성은 유사한 오픈 소스 모델을 계속해서 능가할 수 있습니다.

메타 수준의 교육 자원 및 보안 투자: Llama 시리즈는 Meta AI 연구소(FAIR)의 수백 명의 연구원의 핵심 연구 성과입니다. 교육 데이터 규모(Llama 3.1은 15조 개의 토큰 사용)와 보안 조정 연구에 대한 투자가 대부분의 오픈 소스 프로젝트의 규모를 훨씬 초과하므로 Llama는 보안 및 포괄적인 기능 측면에서 최고의 폐쇄 소스 모델에 가까운 경쟁력을 갖습니다.

Llama 3.3 70B의 궁극적인 비용 효율성: Llama 3.3 70B는 405B 모델의 명령 추종 기능 대부분을 70B 매개변수로 압축하여 고품질 오픈 소스 LLM의 배포 임계값을 크게 낮춥니다. 70B 양자화 버전은 단일 H100 또는 2×A100에서 효율적으로 실행될 수 있어 405B에 비해 GPU 리소스를 80% 이상 절약합니다. 현재 오픈 소스 LLM입니다. 가격 대비 가치의 정점입니다.

사용방법

입구 설명
포옹얼굴 https://huggingface.co/meta-llama에서 모델 가중치 다운로드 (접근 권한 필요)
Ollama(가장 간단한 로컬 배포) Ollama 설치: ollama pull llama3.1:8b, 로컬 배포를 완료하는 명령 하나로
메타 공식 홈페이지 신청 상업적 사용 신청서를 제출하려면 https://llama.meta.com/llama-downloads를 방문하세요
클라우드 API Together AI, Groq, AWS Bedrock 등 서비스 제공업체 API를 통해 액세스
vLLM 생산 추론 vLLM 프레임워크를 사용하여 처리량이 높은 프로덕션 추론 서비스 배포

일반적인 사용 단계(Ollama 로컬 빠른 배포 Llama 3.1 8B):

  1. https://ollama.com을 방문하여 Ollama(macOS/Linux/Windows 지원)를 다운로드하고 설치하세요.
  2. 터미널에서 ollama run llama3.1을 실행합니다(8B 모델, 약 4.7GB 자동 다운로드).
  3. 다운로드가 완료된 후 터미널에서 직접 대화를 시작하거나 로컬 API(http://localhost:11434)를 통해 애플리케이션에 통합합니다.
  4. 더 큰 모델이 필요합니다: ollama run llama3.1:70b(최소 40GB 비디오 메모리가 필요하거나 Apple M2 Max/Ultra를 지원함).
  5. 미세 조정이 필요합니다. HuggingFace로 이동하여 액세스를 신청하고 원본 가중치를 다운로드한 후 LoRA 미세 조정을 위해 LLaMA-Factory 또는 Axolotl 프레임워크를 사용하세요.

제품 가격

Llama 시리즈 모델 가중치는 완전히 무료이며 개방적이지만 사용 시나리오에 따라 비용 구조가 다릅니다.

  • 모델 중량 다운로드: 완전 무료입니다. 허깅페이스(HuggingFace)나 메타 공식 홈페이지에서 신청 후 무료로 다운로드할 수 있다. 월간 활성 사용자가 700만 명 미만(MAU < 700M)인 경우 상업적 용도로 무료입니다. 이를 초과하는 경우 Meta에서 특별 라이센스를 신청해야 합니다.
  • 로컬 배포(llama.cpp/Ollama): 하드웨어 비용만 있고 지속적인 비용은 없습니다. RTX 3090(24GB)은 13B 양자화 모델을 원활하게 실행할 수 있으며, Apple M2 MacBook Pro는 7B/8B 양자화 모델을 실행할 수 있습니다.
  • 클라우드 추론(제3자 서비스): Together AI($0.20/백만 토큰), Groq($0.05/백만 토큰), AWS Bedrock 등을 통해 액세스하고 사용량에 따라 지불합니다.
  • 자체 호스팅 vLLM: GPU 서버 또는 클라우드 GPU 인스턴스 비용, 프로덕션 등급 8B 모델에는 일반적으로 A10G 또는 RTX 4090급 GPU가 필요하며 가격은 동시성 및 사용되는 클라우드 공급자에 따라 다릅니다.
  • 메타 공식 API(Meta AI): Meta는 자체 제품을 통해 Llama 기능을 제공하며, 일부 API 기능은 파트너에게 공개됩니다.

애플리케이션 시나리오

  1. 기업용 민영화 AI 도우미 배포: 금융, 의료, 법률 등 데이터 보안에 민감한 산업에서 Llama 3.1 70B는 내부 지식 베이스 Q&A, 파일 분석 및 코드 지원 도구로 기업 인트라넷에 배포됩니다. 데이터는 기업 네트워크 외부로 전혀 나가지 않으므로 ChatGPT/Claude와 같은 클라우드 API를 사용할 때 데이터 규정 준수 문제를 해결합니다.

  2. 오픈 소스 LLM 연구 및 벤치마킹: AI 연구자들은 Llama를 연구 벤치마크 모델로 사용하고 이를 기반으로 새로운 미세 조정 방법, 정렬 기술 및 추론 최적화에 대한 학술 연구를 수행합니다. 개방형 가중치는 실험 재현성과 연구 커뮤니티 협업을 가능하게 하며 NLP 연구 분야의 핵심 개방형 인프라입니다.

  3. 도메인별 모델 미세 조정: 기업 및 연구 기관은 Llama 3.1 8B/70B를 기반으로 감독 미세 조정 및 지침 정렬을 수행하고, 의료 지식, 법률 규정, 기업 데이터 등 전문 도메인 지식을 모델에 주입하여 상대적으로 저렴한 비용으로 고도로 전문화된 도메인 AI 보조자를 구축합니다.

  4. 코드 생성 및 개발 지원: 코드 데이터로 미세 조정된 Code Llama 또는 Llama 변형을 사용하여 코드 완성, 코드 설명 및 버그 수정 도우미를 로컬로 배포하여 코드 지적 재산이 GitHub Copilot과 같은 클라우드 서비스를 통해 전송되는 것을 방지합니다. 이는 민감한 지적 재산권을 가진 소프트웨어 회사에 적합합니다.

  5. AI 애플리케이션 프로토타입 및 교육: 개발자와 학생은 Ollama + Llama를 사용하여 로컬에서 LLM 실험 환경을 빠르게 구축할 수 있습니다. API 호출 비용이 없다는 특징으로 인해 수많은 대화형 실험이 가능해집니다. LLM 애플리케이션 개발을 학습하고 교육하기 위한 이상적인 낮은 임계값 플랫폼입니다.

해당자

  • 엄격한 데이터 개인 정보 보호 요구 사항이 있는 기업: AI 기능을 로컬/인트라넷에 배포해야 하며 타사 API로 데이터를 보낼 수 없는 금융, 의료, 정부 기관.
  • AI 연구원: 학문적 연구를 위해 내부 가중치가 있는 미세 조정 가능하고 재현 가능하며 접근 가능한 기본 모델이 필요한 NLP 연구원입니다.
  • AI 애플리케이션 개발자: API 종속성을 제거하고, 추론 비용을 줄이거나, 완전히 자율적이고 제어 가능한 모델이 필요한 AI 제품 개발자입니다.
  • 학생 및 AI 학습자: 무료 개방 가중치를 통해 GPU를 사용하는 모든 학습자가 세계적 수준의 LLM에 액세스할 수 있으며 AI 교육을 위한 중요한 공개 리소스입니다.
  • 부적절한 시나리오: "설정 없이 바로 사용할 수 있는 작업"에 대한 강한 요구가 있는 비기술적 사용자(ChatGPT/Claude를 직접 사용하는 것이 더 쉽습니다) 최신 지식이 필요합니다(Llama에는 교육 기한이 있지만 클라우드 API 지식만큼 실시간이 아닙니다). 심각하게 제한된 컴퓨팅 성능(정량화된 8B 모델은 CPU에서 매우 느리게 실행됨) 최고 수준의 GPT-4 수준 기능이 필요하지만 405B 모델을 실행하기에 충분한 GPU가 없는 시나리오(클라우드 API가 더 실용적임)

요약 및 전망

Llama 시리즈의 지속적인 출시는 최근 몇 년 동안 오픈 소스 AI 운동의 가장 중요한 동인 중 하나였습니다. Llama 1의 연구 독점 사용부터 Llama 2의 상업적 개방, GPT-4에 정면으로 도전하는 Llama 3.1 405B의 기술 성숙도에 이르기까지 Meta는 개방형 전략으로 세계 최대의 오픈 소스 LLM 사용자 및 기여자의 생태계를 구축하여 상용 폐쇄 소스 모델로는 복제하기 어려운 커뮤니티 해자를 형성했습니다.

Llama 3.3 70B의 출시는 "대형 모델 기능을 작은 모델로 보다 효율적으로 추출"하는 기술적 방향의 타당성을 추가로 검증하며, 이는 오픈 소스 LLM이 비용 성능 측면에서 폐쇄 소스 모델과의 격차를 계속해서 좁힐 것임을 나타냅니다.

후속 초점: Llama 4 시리즈의 출시 시간 및 성능(하이브리드 전문 아키텍처 MoE 채택 예정), 다중 모드 기능의 추가 향상(Llama 3.2 Vision 로드맵의 확장), 모바일 장치에서 Llama 엔드사이드 모델(1B/3B)의 최적화된 배포, Meta가 개방성을 유지하면서 상업적 경쟁력을 유지하는 방법은 Llama 생태계의 다음 단계의 핵심 하이라이트가 될 것입니다.

관련 도구: 포옹하는 얼굴, replicate

버전 정보

  • 라마 3.3 70B :라마 3.3 70B가 출시되었습니다. 70B 매개변수 규모를 유지하면서 명령 추종 능력을 Llama 3.1 405B에 가까운 수준으로 향상시켜 성능/가격 비율을 더욱 최적화했습니다. 다중 언어 기능이 크게 향상되었으며 수학 및 코드 생성 벤치마크 점수도 크게 향상되었습니다. 전체적으로 최고의 비용 성능을 갖춘 오픈 소스 교육 모델이 되었으며 배포 비용을 줄이기 위해 Llama 3.1 405B를 대체하는 데 널리 사용됩니다.
  • 라마 3.1 (8B/70B/405B) :Llama 3.1은 현재까지 Meta가 출시한 가장 중요한 마일스톤 버전입니다. 최초로 405B 플래그십 모델(GPT-4o 및 Claude 3.5 Sonnet을 벤치마킹한 종합 성능)을 출시했으며, 컨텍스트 창을 128K 토큰으로 확장하고, 8개의 새로운 다국어 지원을 추가했으며, 모든 스케일 모델을 상업용으로 공개하고(월간 활성 사용자 수가 7억 명 미만), HuggingFace 첫날 다운로드 수가 오픈 소스 모델의 역사적 기록을 세웠습니다.
  • 라마 2(7B/13B/70B) :라마 2(Llama 2)는 최초로 상업용 라이센스로 정식 출시되었으며, 7B/13B/34B/70B의 4가지 매개변수 크기를 제공하는 동시에 대화에 최적화된 Chat의 변형 버전(Llama 2 Chat)을 출시했습니다. 당시 가장 많이 다운로드된 오픈소스 LLM이 되어 오픈소스 AI 응용 프로그램 개발 생태계의 번영을 크게 촉진했으며 오픈소스 AI 커뮤니티는 가속화된 개발 단계에 들어갔습니다.

사용자 후기

  • 후기를 불러오는 중...