Lama Gratuit

-

Llama est une série de grands modèles de langage open source publiés par Meta. Il s'agit actuellement du de poids ouvert le plus largement utilisé. Llama 3.1 fournit trois tailles de paramètres de 8B/70B/405B, prend en charge le contexte de jeton 128K et 8 langues. Il peut être utilisé à des fins commerciales sous la licence Meta Llama (gratuite sous 700M MAU), et a été téléchargé plus de 300 millions de fois sur HuggingFace.

Lama Interface du produit

Llama — Grande série de modèles de langage méta open source

Paramètres et statistiques de base

Paramètres Détails
Dernière version majeure Lama 3.3 70B / Lama 3.2 (y compris la version visuelle) / Lama 3.1 405B
Options d'échelle des paramètres 1B, 3B, 8B, 11B (visuel), 70B, 90B (visuel), 405B
Fenêtre de contexte maximale Jeton 128K (série Lama 3.1/3.2)
Prise en charge multilingue 8 langues (anglais, chinois, français, allemand, italien, portugais, espagnol, indien)
Licence Licence Meta Llama (<700M MAU, gratuite pour un usage commercial, application requise pour plus de 700M MAU)
Canaux de diffusion HuggingFace, lama.meta.com, principaux fournisseurs de services cloud
Téléchargements HuggingFace Plus de 300 millions de fois (cumulé en 2024)
Modèles variantes Code Llama (code), Llama Guard (filtrage de sécurité), Llama 3.2 Vision
Prise en charge de la quantification GGUF (llama.cpp), GPTQ, AWQ et autres formats de quantification
Cadre d'inférence lama.cpp, vLLM, HuggingFace Transformers, Ollama, etc.

La série Llama est l'une des forces les plus importantes à l'origine de la démocratisation de l'IA open source : en ouvrant des pondérations de modèles pré-entraînés à grande échelle, Meta permet aux développeurs mondiaux d'exécuter, d'affiner et de déployer localement de grands modèles de langage hautement compétitifs sur leur propre matériel sans recourir aux appels d'API, modifiant ainsi fondamentalement le paysage de développement des applications d'IA.

Reconnaissance des utilisateurs et du marché

La série Llama est actuellement la famille LLM open source la plus téléchargée et la plus utilisée. Elle a été téléchargée plus de 300 millions de fois sur HuggingFace et constitue une véritable « infrastructure d'IA open source ». Le rythme de sortie de Llama 2 à Llama 3 prouve l’investissement continu de Meta dans le domaine du LLM open source. Chaque nouvelle version déclenche de nombreuses discussions d'analyse comparative et un partage de pratiques d'application au sein de la communauté technique.

En termes d'applications commerciales, la série Llama est l'un des modèles de base open source préférés des entreprises pour créer des systèmes d'IA privés. Il est particulièrement favorisé par les institutions financières, médicales et gouvernementales ayant des exigences strictes en matière de confidentialité des données : le poids ouvert signifie qu'il peut être déployé complètement hors ligne et que les données ne quittent pas l'intranet de l'entreprise. Dans la communauté de développement de l'IA, un écosystème extrêmement riche s'est formé autour de Llama, comprenant des outils de quantification (llama.cpp), des frameworks de réglage fin (Axolotl, LLaMA-Factory), des interfaces conversationnelles (Open WebUI) et des moteurs d'inférence (vLLM, Ollama). Ce retour écologique positif renforce encore la position dominante de Llama.

Avantage de coût

Méthode Prix ​​ Principaux scénarios applicables Caractéristiques
Déploiement local (llama.cpp) Coût du matériel (unique) Applications personnelles, de recherche et de confidentialité Entièrement gratuit, les données ne quittent pas le territoire
Raisonnement cloud (Together AI) Jeton de 0,20 $/million (8 milliards) Accès rapide aux applications d'IA Facturation à l'utilisation, pas besoin de gérer le matériel
Raisonnement cloud (Groq) Jeton de 0,05 $/million (8 milliards) Faible latence et appels haute fréquence Latence ultra-faible, adaptée aux applications en temps réel
Auto-hébergé (vLLM + GPU) Coûts du matériel GPU/cloud Déploiements de production d'entreprise à haute simultanéité Flexibilité maximale, entièrement personnalisable

Par rapport à GPT-4 Turbo (10 $/million de jetons) : Llama 3.1 70B obtient des performances proches ou équivalentes dans plusieurs tests de référence, tandis que le coût des appels via Together AI n'est que de 0,88 $/million de jetons, soit un prix environ 90 % inférieur ; le déploiement local ne nécessite qu'un investissement matériel unique et aucun coût d'API continu.

Fonctions principales

  • Options d'échelle multiples Llama 3.1 8B/70B/405B : du 8B léger (peut fonctionner sur un GPU grand public) au produit phare 405B (performances complètes comparées à GPT-4o), répondant à différents budgets de puissance de calcul et besoins de performances, les utilisateurs peuvent choisir l'échelle rentable optimale en fonction du scénario.
  • Traitement de contexte long de 128 000 jetons : la série Llama 3.1 étend la fenêtre de contexte à 128 000 jetons, prenant en charge le traitement de documents ultra-longs, l'analyse de la base de code et plusieurs séries de conversations approfondies, permettant à Llama d'entrer sur le marché des applications à contexte long que seuls quelques LLM prenaient en charge auparavant.
  • Capacités multilingues (8 langues) : Llama 3.1 prend en charge nativement le chinois, le français, l'allemand, l'italien, le portugais, l'espagnol et l'hindi en plus de l'anglais, permettant une conversation et un traitement de texte multilingues sans avoir besoin d'une couche intermédiaire de traduction.
  • Code Llama (variante spécifique au code) : variante de Llama optimisée pour les tâches de compréhension, de génération et de débogage du code. Il prend en charge plusieurs langages de programmation courants tels que Python, Java, C++, TypeScript, etc., et constitue un choix important pour les grands modèles de code open source.
  • Llama Guard (modèle de filtrage de sécurité) : un modèle de classification de sécurité du contenu formé sur la base de l'architecture Llama. Il est utilisé pour détecter et filtrer les contenus nuisibles dans les conversations d'IA, aidant ainsi les développeurs à créer des applications d'IA conformes aux normes de sécurité. Il peut être intégré en tant que composant indépendant.
  • Llama 3.2 Vision (version multimodale) : une variante multimodale de Llama (11B et 90B) qui prend en charge la compréhension des images, peut gérer une saisie mixte d'images et de texte et effectuer des tâches visuelles telles que la description d'images, la réponse visuelle à des questions et la compréhension d'images de documents.
  • Les poids ouverts peuvent être affinés : les poids complets du modèle peuvent être téléchargés, prenant en charge le réglage fin complet des paramètres (Full Fine-tuning) ou le réglage fin efficace des paramètres (LoRA, QLoRA) sur ses propres données, injectant des connaissances du domaine dans le modèle pour créer des modèles industriels exclusifs.
  • Prise en charge des versions quantifiées (appareils basse consommation) : les modèles quantifiés 7B/8B peuvent être exécutés à des vitesses acceptables sur les Mac Apple Silicon (tels que le MacBook Pro M2) ou les GPU grand public via le format quantifié GGUF (llama.cpp),

Élargit considérablement la gamme de matériel pouvant exécuter Llama.

Evolution du modèle et de la version

Version Date de sortie Descriptif
Lama 1 (7B/13B/33B/65B) 2023-02 La première série Llama, à usage de recherche uniquement, aucune utilisation commerciale autorisée
Lama 2 (7B/13B/34B/70B) 2023-07-18 Licence commerciale ouverte pour la première fois, version optimisée pour le dialogue Chat, version importante
Code Lama 2023-08-24 Modèle spécifique au code basé sur Llama 2, prenant en charge la complétion et la génération de code
Lama 2 Long 2023-09 Étendre le contexte Llama 2 à 32 Ko, orienté vers les scénarios de documents longs
Lama 3 (8B/70B) 2024-04-18 Les performances globales sont grandement améliorées, contexte 8K, dépassant le modèle Gemma/Mistral avec la même échelle de paramètres
Lama 3.1 (8B/70B/405B) 2024-07-23 Version phare, contexte 128 Ko, GPT-4o comparé à 405 Ko, prise en charge multilingue, entièrement commerciale
Lama 3.2 (1B/3B/11B/90B) 2024-09-25 Ajout d'un modèle d'extrémité léger 1B/3B et d'un modèle de langage visuel 11B/90B
Lama 3.3 70B ~2024-12 Les performances du 70B ont été considérablement améliorées, proches du niveau 405B, le modèle d'instruction open source le plus rentable

Avantages techniques

Flexibilité de déploiement apportée par le poids ouvert : La valeur fondamentale de Llama réside dans le "poids ouvert" - contrairement aux modèles à source fermée qui fournissent des appels API, Llama permet aux utilisateurs de télécharger le fichier de modèle complet et de l'exécuter sur n'importe quel matériel, sans limite sur le nombre d'appels, sans risque de transmission de données et sans risque de dépendance à l'API. Cette fonctionnalité est particulièrement importante pour les entreprises sensibles à la sécurité des données et constitue la base technique pour construire un système d’IA entièrement autonome et contrôlable.

Puissant écosystème open source : la chaîne d'outils la plus complète de l'écosystème open source LLM actuel a été formée autour de Llama : llama.cpp implémente vLLM pour l'inférence locale sur du matériel grand public, implémente l'inférence à haut débit de qualité production, Ollama offre une expérience de déploiement local en un clic, LLaMA-Factory et Axolotl fournissent des outils de réglage précis pratiques et Open WebUI fournit une belle interface conversationnelle. Cette boucle de rétroaction écologique positive permet à la convivialité de Llama de continuer à surpasser les modèles open source similaires.

Ressources de formation au niveau méta et investissement dans la sécurité : La série Llama est le principal résultat de recherche de centaines de chercheurs du Meta AI Research Institute (FAIR). L'ampleur des données de formation (Llama 3.1 utilise 15 000 milliards de jetons) et les investissements dans la recherche sur l'alignement de la sécurité dépassent de loin ceux de la plupart des projets open source, ce qui rend Llama compétitif, proche des meilleurs modèles fermés en termes de sécurité et de capacités complètes.

La rentabilité ultime de Llama 3.3 70B : Llama 3.3 70B compresse la plupart des capacités de suivi d'instructions du modèle 405B aux paramètres 70B, abaissant considérablement le seuil de déploiement d'un LLM open source de haute qualité - la version quantifiée 70B peut fonctionner efficacement sur un seul H100 ou 2 × A100, économisant plus de 80 % des ressources GPU par rapport au 405B, et est le LLM open source actuel Le summum du rapport qualité-prix.

Comment utiliser

Entrée Descriptif
CâlinsVisage Téléchargez les poids des modèles sur https://huggingface.co/meta-llama (autorisation d'accès requise)
Ollama (le déploiement local le plus simple) Installez Ollama : ollama pull llama3.1:8b, une commande pour terminer le déploiement local
Application du site officiel Meta Visitez https://llama.meta.com/llama-downloads pour soumettre une demande d'utilisation commerciale
API Cloud Accessible via les API des fournisseurs de services telles que Together AI, Groq, AWS Bedrock, etc.
Inférence de production vLLM Déployer des services d'inférence de production à haut débit à l'aide du framework vLLM

Étapes d'utilisation typiques (déploiement rapide local Ollama Llama 3.1 8B) :

  1. Visitez https://ollama.com pour télécharger et installer Ollama (prend en charge macOS/Linux/Windows).
  2. Exécutez dans le terminal : ollama run llama3.1 (télécharge automatiquement le modèle 8B, environ 4,7 Go).
  3. Une fois le téléchargement terminé, démarrez la conversation directement dans le terminal ou intégrez-la à l'application via l'API locale (http://localhost:11434).
  4. Un modèle plus grand est requis : ollama run llama3.1:70b (nécessite au moins 40 Go de mémoire vidéo ou prend en charge Apple M2 Max/Ultra).
  5. Un réglage fin est requis : accédez à HuggingFace pour demander l'accès, téléchargez les poids d'origine et utilisez le framework LLaMA-Factory ou Axolotl pour le réglage fin de LoRA.

Prix des produits

Les poids des modèles de la série Llama sont entièrement gratuits et ouverts, mais différents scénarios d'utilisation ont des structures de coûts différentes :

  • Téléchargement du poids du modèle : entièrement gratuit. Vous pouvez le télécharger gratuitement après avoir postulé sur le site officiel de HuggingFace ou Meta. Il est gratuit pour un usage commercial avec moins de 7 millions d’utilisateurs actifs mensuels (MAU < 700M). Si cela dépasse, vous devez demander une licence spéciale auprès de Meta.
  • Déploiement local (llama.cpp/Ollama) : uniquement le coût matériel, pas de frais courants, le RTX 3090 (24 Go) peut exécuter un modèle quantifié 13 B en douceur, le MacBook Pro Apple M2 peut exécuter un modèle quantifié 7B/8B.
  • Inférence Cloud (service tiers) : accessible via Together AI (à partir de 0,20 $/million de jetons), Groq (à partir de 0,05 $/million de jetons), AWS Bedrock, etc., paiement à l'utilisation.
  • VLLM auto-hébergé : coût du serveur GPU ou de l'instance GPU cloud, les modèles 8B de niveau production nécessitent généralement un GPU de classe A10G ou RTX 4090, le prix varie en fonction de la concurrence et du fournisseur de cloud utilisé.
  • API Meta officielle (Meta AI) : Meta fournit des fonctionnalités Llama via ses propres produits, et certaines fonctions API sont ouvertes aux partenaires.

Scénarios d'application

  1. Déploiement d'un assistant IA privatisé par l'entreprise : dans les secteurs sensibles à la sécurité des données tels que la finance, les soins médicaux et le droit, Llama 3.1 70B est déployé sur l'intranet de l'entreprise en tant qu'outil de questions-réponses de base de connaissances interne, d'analyse de fichiers et d'outil d'assistance au code. Les données ne quittent pas du tout le réseau de l'entreprise, ce qui résout les problèmes de conformité des données lors de l'utilisation d'API cloud telles que ChatGPT/Claude.

  2. Recherche et analyse comparative open source LLM : les chercheurs en IA utilisent Llama comme modèle de référence de recherche, sur la base duquel ils mènent des recherches universitaires sur de nouvelles méthodes de réglage fin, des techniques d'alignement et d'optimisation d'inférence. Les poids ouverts permettent la reproductibilité expérimentale et la collaboration de la communauté de recherche, et constituent l'infrastructure ouverte de base dans le domaine de recherche en PNL.

  3. Réglage précis du modèle spécifique au domaine : les entreprises et les instituts de recherche effectuent un réglage fin de la supervision et un alignement des instructions sur la base de Llama 3.1 8B/70B, et injectent des connaissances professionnelles dans le domaine telles que les connaissances médicales, les dispositions juridiques et les données d'entreprise dans le modèle pour créer des assistants d'IA de domaine hautement spécialisés à un coût relativement faible.

  4. Génération de code et aide au développement : utilisez Code Llama ou des variantes de Llama affinées avec des données de code pour déployer localement des assistants de complétion de code, d'explication de code et de réparation de bogues afin de protéger la propriété intellectuelle du code contre la transmission via des services cloud tels que GitHub Copilot, qui convient aux éditeurs de logiciels ayant des droits de propriété intellectuelle sensibles.

  5. Prototype d'application d'IA et formation : les développeurs et les étudiants peuvent utiliser Ollama + Llama pour créer rapidement des environnements d'expérimentation LLM localement. La fonctionnalité sans coût d’appel API rend possible un grand nombre d’expériences interactives. Il s'agit d'une plate-forme idéale à bas seuil pour l'apprentissage et l'enseignement du développement d'applications LLM.

Personnes concernées

  • Entreprises ayant des exigences strictes en matière de confidentialité des données : institutions financières, médicales et gouvernementales qui doivent déployer des capacités d'IA localement/intranet et ne peuvent pas envoyer de données à des API tierces.
  • Chercheurs en IA : chercheurs en PNL qui ont besoin d'un modèle de base précis, reproductible et accessible avec des pondérations internes pour la recherche universitaire.
  • Développeurs d'applications IA : développeurs de produits IA qui souhaitent se débarrasser des dépendances aux API, réduire les coûts d'inférence ou qui ont besoin que les modèles soient entièrement autonomes et contrôlables.
  • Étudiants et apprenants en IA : les pondérations ouvertes gratuites rendent le LLM de classe mondiale accessible à tout apprenant disposant d'un GPU et constituent une ressource ouverte importante pour l'enseignement de l'IA.
  • Scénarios inappropriés : Utilisateurs non techniques qui ont une forte demande d'un « fonctionnement prêt à l'emploi sans aucun réglage » (il est plus facile d'utiliser ChatGPT/Claude directement) ; besoin des dernières connaissances (Llama a une date limite de formation, qui n'est pas aussi en temps réel que les connaissances de l'API cloud) ; puissance de calcul très limitée (le modèle 8B quantifié fonctionne extrêmement lentement sur le processeur) ; des scénarios qui nécessitent des capacités de premier ordre au niveau GPT-4 mais ne disposent pas de suffisamment de GPU pour exécuter le modèle 405B (l'API cloud est plus pratique).

Résumé et Outlook

La sortie continue de la série Llama a été l’un des moteurs les plus importants du mouvement de l’IA open source ces dernières années. De la recherche sur l'utilisation exclusive de Llama 1 à l'ouverture commerciale de Llama 2, en passant par la maturité technologique de Llama 3.1 405B, qui défie de front GPT-4, Meta a construit le plus grand écosystème au monde d'utilisateurs et de contributeurs LLM open source avec une stratégie ouverte, formant un fossé communautaire difficile à reproduire avec des modèles commerciaux à source fermée.

La sortie de Llama 3.3 70B vérifie en outre la faisabilité de la direction technique consistant à « distiller plus efficacement les capacités des grands modèles en petits modèles », indiquant que le LLM open source continuera de réduire l'écart avec les modèles fermés en termes de rapport coût/performance.

Objectif de suivi : le délai de sortie et les performances de la série Llama 4 (qui devrait adopter l'architecture experte hybride MoE), l'amélioration continue des capacités multimodales (une extension de la feuille de route Llama 3.2 Vision), le déploiement optimisé des modèles finaux Llama (1B/3B) sur les appareils mobiles et la manière dont Meta maintient la compétitivité commerciale tout en maintenant l'ouverture seront les points forts de la prochaine phase de l'écosystème Llama.

Outils associés : , replicate

Informations de version

  • Lama 3.3 70B :Llama 3.3 70B est sorti. Tout en conservant l'échelle de paramètres 70B, il a amélioré la capacité de suivi des instructions à un niveau proche de Llama 3.1 405B, optimisant encore davantage le rapport performance/prix ; ses capacités multilingues ont été considérablement améliorées et ses scores de référence en mathématiques et en génération de code se sont considérablement améliorés. Il est devenu un modèle d'instruction open source offrant le meilleur rapport coût-performance global et est largement utilisé pour remplacer Llama 3.1 405B afin de réduire les coûts de déploiement.
  • Lama 3.1 (8B/70B/405B) :Llama 3.1 est la version la plus importante publiée par Meta à ce jour. Il a lancé pour la première fois le modèle phare 405B (analyse comparative complète des performances GPT-4o et Claude 3.5 Sonnet), la fenêtre contextuelle a été étendue à 128 000 jetons, 8 nouveaux supports multilingues ont été ajoutés, tous les modèles réduits sont ouverts à un usage commercial (moins de 700 millions d'utilisateurs actifs mensuels) et le nombre de téléchargements le premier jour de HuggingFace a établi un record historique pour les modèles open source.
  • Lama 2 (7B/13B/70B) :Llama 2 a été officiellement publié, avec une licence d'utilisation commerciale pour la première fois, fournissant quatre tailles de paramètres de 7B/13B/34B/70B, et publiant simultanément une variante de Chat (Llama 2 Chat) optimisée pour le dialogue. Il est devenu le LLM open source le plus téléchargé à l'époque, ce qui a grandement favorisé la prospérité de l'écosystème de développement d'applications d'IA open source, et la communauté de l'IA open source est entrée dans une phase de développement accélérée.

Avis des utilisateurs

  • Chargement des avis...