Laboratoires Lambda

-

Lambda Labs propose la location cloud de GPU NVIDIA et des postes de travail d'apprentissage en profondeur de marque privée, couvrant une infrastructure d'IA hautes performances, de la formation sur une seule carte aux clusters H100.

Laboratoires Lambda Interface du produit

LambdaLabs

Paramètres et statistiques de base de Lambda Labs

Lambda Labs (la marque sera simplifiée en Lambda à partir de 2025 et le nom de domaine sera migré vers lambda.ai) est l'un des rares fournisseurs d'infrastructure à couvrir la location de GPU cloud, les postes de travail d'IA de marque propre et les usines d'IA à très grande échelle. Son cloud GPU compare directement les instances GPU AWS EC2 et la série Azure ND, mais est plus approfondi dans la spécialisation des charges de travail d'IA : il ne fait pas de calcul général et ne sert qu'à la formation et à l'inférence de l'IA.

Projets Informations publiques
Positionnement officiel Fournisseur d'infrastructure d'IA (le cloud de superintelligence)
Activité principale Cluster en 1 clic d'instance GPU Cloud, usine d'IA Super Cluster, station de travail d'apprentissage profond
Modèles de GPU (derniers) NVIDIA VR200 NVL72, GB300 NVL72, HGX B300, HGX B200, H100 SXM, A100 SXM
Modèles de GPU (génération précédente) NVIDIA A100 SXM (80 Go/40 Go), Tesla V100
Formulaire de déploiement Cloud (libre-service + hébergement) + matériel local
Gamme de produits de base Instances GPU, 1-Click Clusters™, superclusters, usines d'IA, pile Lambda
Groupes de clients cibles Laboratoires d'IA de pointe, hyperscalers, entreprises, gouvernements, instituts de recherche, équipes de start-up
Partenaires NVIDIA (Exemplar Cloud + 7x Partenaire de l'année), Supermicro, Dell
Certification de sécurité SOC2 Type II
Barème de financement Le financement cumulatif par actions dépasse 1,5 milliard de dollars (TWG Global, USIT, etc.)
Cas clients clés Microsoft (contrats pluriannuels d'un milliard de dollars), Kodiak Robotics (conduite autonome), Hudson River Trading (commerce quantitatif)

Positionnement architectural : Lambda ne construit pas de couche de plate-forme SaaS, mais fournit directement une puissance de calcul GPU nue, connectée à des frameworks ML tels que PyTorch/TensorFlow, et connectée à la pile Lambda auto-développée (préinstallée avec des bibliothèques sous-jacentes telles que CUDA, cuDNN, NCCL). Cela signifie que les utilisateurs bénéficient de performances proches du matériel local, mais sans le fardeau de l'exploitation et de la maintenance du centre de données.

Reconnaissance des utilisateurs et du marché de Lambda Labs

La reconnaissance de Lambda sur le marché se reflète principalement à trois niveaux :

Gamme de clients : les organisations d'IA les plus avant-gardistes au monde utilisent directement l'infrastructure Lambda, y compris l'hyperscaler (le contrat pluriannuel de plusieurs milliards de dollars de Microsoft), les laboratoires d'IA de pointe (formation de modèles de base au niveau de centaines de milliards de paramètres), les entreprises industrielles réglementées (finance, conduite autonome, etc.) et les agences gouvernementales. Kodiak Robotics utilise Lambda pour former son système de conduite autonome « ​​Kodiak Driver », et 28 camions sans pilote transportent déjà du fret commercial sur la voie publique ; Hudson River Trading s'est tourné vers Lambda après que la puissance de calcul de son propre centre de données ait atteint un sommet. Ces cas vérifient la compétitivité de Lambda en termes de flexibilité et de fiabilité de la puissance de calcul.

Évaluation de l'industrie : Lambda a soumis les résultats de la formation Llama 3.1 8B basés sur NVIDIA GB300 NVL72 dans MLPerf Training v6.0 (juin 2026). Les performances se sont améliorées de 18,7 % par rapport au cycle précédent et il a également obtenu les résultats de formation MoE les plus rapides sur le HGX B200. Lambda est également le premier fournisseur de services cloud à publier les résultats de l'audit STAC-AI™ LANG6 sur NVIDIA HGX B200, fournissant spécifiquement des données vérifiables par des tiers sur les performances d'inférence de l'IA dans des scénarios de services financiers.

NVIDIA Niche : Lambda est un NVIDIA Exemplar Cloud Partner (certifié en octobre 2025) et a reçu le prix NVIDIA Partner of the Year pendant sept années consécutives. Cette certification signifie que Lambda bénéficie d'un avantage non disponible par rapport aux autres petits fournisseurs de cloud GPU en termes de priorité d'expédition, de support technique et d'accès anticipé aux derniers GPU de NVIDIA.

Reconnaissance des analystes et des médias : Lambda a levé plus de 1,5 milliard de dollars de financement cumulé auprès d'investisseurs, dont TWG Global et USIT, reflétant la reconnaissance par le capital institutionnel de son parcours technique et de son modèle commercial. Le contrat pluriannuel de plusieurs milliards de dollars conclu avec Microsoft en novembre 2025 est l’une des collaborations commerciales les plus emblématiques de l’industrie du cloud GPU.

Avantage de coût de Lambda Labs

L'avantage de Lambda en matière de structure de coûts provient de trois niveaux : la chaîne d'approvisionnement en matériel, la spécialisation en architecture et la stratégie de zéro frais cachés.

Comparaison des prix des instances cloud GPU par heure

Modèle GPU Mémoire vidéo Processeur virtuel Mémoire SSD Prix ​​Lambda ($/GPU·h)
NVIDIA B200 SXM6 180 Go 208 2900 Gio 22 Tio 6,69 $
NVIDIA H100 SXM 80 Go 208 1 800 Gio 22 Tio 3,99 $
NVIDIA A100 SXM (80 Go) 80 Go 240 1 800 Gio 19,5 Tio 2,79 $
NVIDIA A100 SXM (40 Go) 40 Go 124 1 800 Gio 5,8 Tio 1,99 $
NVIDIA Tesla V100 16 Go 88 448 Gio 5,8 Tio 0,79 $

Comparaison des prix des clusters en 1 clic

Configuration Bail Nombre de GPU Prix ​​($/GPU·h)
NVIDIA HGX B200 2 semaines – 1 an 16 9,86 $
NVIDIA HGX B200 2 semaines – 1 an 64 9,36 $
NVIDIA HGX B200 2 semaines – 1 an 256+ 8,87 $
NVIDIA HGX B200 1 an+ 16+ Confirmation commerciale

Répartition de la structure des coûts :

  • Aucun frais de sortie : Lambda indique explicitement qu'il n'y a pas de frais de sortie, ce qui est rare dans les cloud GPU. Les instances GPU d'AWS, Azure et GCP facturent généralement entre 0,05 et 0,12 $/Go pour le trafic sortant. Pour les scénarios de formation qui nécessitent des exportations fréquentes de points de contrôle (souvent des centaines de Go), cela représente un coût caché considérable.
  • Facturation à la minute : les instances sont facturées à la minute, sans consommation minimale, adaptées aux formations expérimentales et aux charges d'inférence à cycle court.
  • Réservation et remise sur volume : le prix unitaire du cluster 1-Click diminue d'environ 5 à 10 % lorsque le nombre de GPU augmente (16→64→256+), et des prix plus bas sont disponibles pour les locations à long terme (1 an+), mais une confirmation commerciale est requise.
  • Comparaison avec AWS : le prix à la demande d'AWS p5.48xlarge (8 × H100) est d'environ 24,96 $/GPU·h (doit être converti dans le prix total de l'instance/8). La carte unique H100 de Lambda coûte 3,99 $/GPU·h, ce qui présente des avantages de prix évidents dans les scénarios à la demande. Cependant, il convient de noter que Lambda n'inclut pas les bases de données gérées, l'équilibrage de charge et les compartiments de stockage d'objets des fournisseurs de cloud standard. Ce n’est que de la pure puissance de calcul.

Analyse des coûts à trois niveaux :

  • Client C/chercheur individuel : Louez une seule instance de carte à l'heure, avec un minimum de 0,79 $/h (V100) pour démarrer les expériences, sans prépaiement. Pour les personnes essayant un réglage fin ou une vérification d’inférence à petite échelle, le coût d’entrée est nettement inférieur à celui de l’achat de matériel.
  • Développeur/Équipe : les instances à la demande conviennent à l'expansion élastique ; Les clusters 1-Click conviennent aux équipes projet avec des cycles de formation clairs. Le cluster B200 à 16 cartes coûte environ 9,86 $/GPU·h, soit environ 47 % de plus que les instances à la demande, mais vous obtenez un cluster dédié connecté par InfiniBand.
  • Formation d'entreprise/à grande échelle : les superclusters nécessitent une tarification de confirmation commerciale, allant de 4 000 à plus de 165 000 GPU, y compris les services gérés d'exploitation et de maintenance (Kubernetes/Slurm). Les contrats d'entreprise à long terme peuvent obtenir des prix nettement inférieurs à ceux demandés à la demande, mais il n'y a pas d'offres publiques. Le contrat de plusieurs milliards de dollars de Microsoft constitue la limite inférieure de référence. Sur la base de cette ampleur, le prix unitaire devrait être de l'ordre de 2 à 3 dollars/GPU·h, voire même moins.

Principales fonctionnalités de Lambda Labs

La gamme de produits Lambda est construite autour de quatre niveaux de consommation d'énergie de calcul GPU, d'une seule carte à un cluster de 100 000 cartes, couvrant le cycle de vie complet des charges de travail d'IA.

1. Instances cloud GPU (Instances)

Instances GPU à la demande, en libre-service, premier arrivé, premier servi, dans des configurations à une ou huit cartes. Points d'expérience de base :

  • Prêt à l'emploi : Lambda Stack (PyTorch, TensorFlow, CUDA, cuDNN, NCCL) est préinstallé. Les utilisateurs n'ont pas besoin d'installer manuellement les pilotes et les frameworks ML. La formation peut démarrer dès le démarrage de l'instance.
  • Observabilité en temps réel : tableau de bord et API intégrés pour surveiller l'utilisation du GPU, la mémoire, les performances du réseau et prend en charge l'intégration Prometheus/Grafana.
  • Stockage persistant : les points de contrôle et les sorties des ensembles de données restent montés entre les sessions. L'expansion ascendante et descendante ne nécessite pas de nouveau téléchargement de données et aucun frais de trafic sortant n'est facturé.
  • Gestion multi-entrées : prend en charge trois méthodes de création/arrêt/redémarrage d'instances via l'interface utilisateur, l'API Cloud et la CLI, ce qui facilite l'intégration dans les scripts CI/CD ou d'orchestration.

Flux de travail typique : le chercheur télécharge l'ensemble de données → sélectionne l'instance H100 → entre dans la formation dans les 5 minutes → utilise l'API pour surveiller la courbe de perte → enregistre le point de contrôle une fois terminé → détruit l'instance. L'ensemble du processus ne nécessite aucune intervention manuelle en matière d'exploitation et de maintenance.

2. Clusters en 1 clic™

Pour les équipes qui vont au-delà de la formation sur une seule machine et qui nécessitent une formation distribuée. Réservation en libre-service, clusters interconnectés InfiniBand de 16 à 2 000+ GPU :

  • Interconnexion réseau : réseau Quantum-2 InfiniBand + accélération SHARP, réduisant les goulots d'étranglement de communication dans la formation distribuée.
  • Orchestration gérée : orchestration Kubernetes ou Slurm gérée en option avec prise en charge du stockage d'objets compatible S3.
  • Durée de location flexible : à partir de 2 semaines, jusqu'à 1 an ; prend en charge la vérification rapide à la frontière POC.
  • Transparence des prix : cluster B200 entre 8,87 $ et 9,86 $ par heure GPU, inversement lié au nombre de GPU et à la durée du bail.

3. Supergrappes

Les clusters dédiés à locataire unique pour la formation de modèles de pointe, allant de 4 000 à 165 000+ GPU, constituent les gammes de produits les plus haut de gamme de Lambda :

  • Architecture sans partage : locataire unique, isolation physique, sécurité au niveau matériel.
  • Refroidissement liquide haute densité : refroidissement liquide intégré et alimentation haute densité pour augmenter la densité de puissance de calcul par watt.
  • Expert Collaborative Engineering : l'équipe Lambda participe à la conception du cluster et au réglage de la charge de travail.
  • Observabilité complète : Prometheus + OpenTelemetry + Grafana, ou connectez-vous au propre système de surveillance du client.
  • Assistance 24h/24 et 7j/7 : une équipe dédiée d'experts répond 24h/24 et 7j/7.

4. Usines d'IA (AI Factory)

Centre de données IA modulaire pour des besoins en puissance de calcul de l'ordre du gigawatt :

  • Extension modulaire : sites distribués de 5 à 75 MW vers un campus de plus de 75 MW, prenant en charge les mises à niveau modulaires d'alimentation électrique et de refroidissement liquide par remplacement à chaud.
  • NVIDIA Deep Integration : Une des premières plateformes de déploiement pour les dernières architectures GPU (VR200 NVL72, GB300 NVL72, HGX B300).
  • Architecture réseau : domaine NVLink (connexion directe GPU dans le nœud) + InfiniBand sans perte + RoCE (Converged Ethernet RDMA), prenant en charge l'expansion du cloud hybride.

5. Produits et outils auxiliaires

  • Lambda Stack : pile logicielle de Deep Learning, préinstallée avec PyTorch, TensorFlow, CUDA, cuDNN, NCCL et le dernier pilote NVIDIA, prenant en charge Ubuntu 22.04/24.04. Non seulement il est préinstallé dans le cloud, mais il peut également être installé manuellement sur un poste de travail local.
  • Kubernetes/Slurm géré : Lambda est responsable de l'exploitation et de la maintenance du plan de contrôle, de la récupération et de la surveillance automatiques des nœuds. Les utilisateurs doivent uniquement soumettre des charges de travail conteneurisées ou des tâches Slurm.
  • Espaces de travail (nouvellement publiés en juin 2026) : aide les équipes à organiser les ressources cloud, à contrôler les autorisations d'accès et à isoler les environnements de développement/préproduction/production dans des environnements GPU partagés.
  • Instances Bare Metal (nouvellement publiées en mai 2026) : fournissent un contrôle complet du matériel (BIOS, paramètres du noyau) tout en conservant les capacités d'automatisation pilotées par API.
  • Benchmarks GPU et indice LLM : données publiques de référence sur les performances du GPU et indice de performance d'inférence LLM pour aider aux décisions de sélection.

[Synergies fonctionnelles] : la gamme de produits Lambda ne se limite pas à la location de GPU de différentes tailles. La véritable synergie réside dans le fait que la même pile logicielle Lambda Stack s'exécute sur le cluster 1-Click de l'instance cloud et le poste de travail local, ce qui signifie que le code débogué par les utilisateurs sur une seule carte peut être migré vers un fonctionnement en cluster à grande échelle sans adaptation. Les espaces de travail et l'API Cloud ouvrent davantage le lien de gestion des ressources, de l'expérimentation personnelle à la collaboration en équipe jusqu'au déploiement en production.

Evolution du modèle et des versions de Lambda Labs

En tant que fournisseur de services d'infrastructure, « l'évolution des versions » de Lambda se reflète dans les mises à jour de génération de matériel, l'expansion de la gamme de produits et les étapes de service.

Temps Jalon Descriptif
2012 Entreprise fondée Fondée à San Francisco par les ingénieurs ML Stephen Balaban et Michael Balaban
~2022 GPU Cloud est en ligne Commence à fournir des services de location d'instances GPU cloud
~2024-06 Cluster hyperplan publié Cluster InfiniBand à large bande passante pour la formation de grands modèles
2025-08 Facilité de crédit garantie de premier rang de 1 G$ Extension des capacités de l'infrastructure de l'IA Factory
2025-10 Certification NVIDIA Exemplaire Cloud L'un des premiers fournisseurs de services cloud à obtenir cette certification
2025-10 Nomination de Stacey Finerman au poste de vice-présidente des relations avec les investisseurs Renforcement des capacités d'opérations de capital
2025-11 Le contrat de plusieurs milliards de dollars de Microsoft Déploiement de dizaines de milliers de GPU NVIDIA pour l'infrastructure IA de Microsoft
2025-11 Financement par actions de plus de 1,5 milliard de dollars réalisé Les investisseurs sont TWG Global, USIT
2026-05 Instance Bare Metal publiée Instance cloud offrant un contrôle matériel complet
2026-05 Audit HGX B200 STAC-AI LANG6 Le premier fournisseur de cloud à publier des données de performances vérifiables dans des scénarios d'IA financière
2026-06 Version des fonctionnalités des espaces de travail Isolation des ressources multi-frontières et contrôle d'accès
2026-06 MLPerf Training v6.0 meilleurs résultats Résultats de formation GB300 NVL72 leader
2026-06 Nom de domaine migré vers lambda.ai Marque simplifiée de Lambda Labs à Lambda
2026-07 Déploiement VR200 NVL72 Lancement de systèmes à l'échelle du rack avec GPU Rubin

Logique évolutive : l'historique des versions de Lambda reflète les caractéristiques des pilotes matériels de l'industrie du cloud GPU : chaque saut de version majeur correspond à l'itération de l'architecture GPU NVIDIA (H100 → B200 → GB300 → VR200). Dans le même temps, Lambda a évolué d'un IaaS pur vers un PaaS géré (espaces de travail gérés Kubernetes/Slurm, Bare Metal) au niveau de la couche logicielle, indiquant qu'il passe d'une simple location de puissance de calcul à une plate-forme « d'infrastructure d'IA en tant que service ».

Les avantages techniques de Lambda Labs

1. Architecture spécialisée

Lambda est un pur cloud d'IA et ne s'occupe pas d'activités informatiques générales. Cela signifie que la conception de son centre de données est entièrement optimisée autour des charges de travail d'IA : tout, de la densité électrique au refroidissement liquide en passant par la topologie du réseau, n'a pas besoin d'être compatible avec les besoins informatiques traditionnels de l'entreprise. Les avantages directs que cela apporte sont une densité de puissance de calcul par watt plus élevée et une utilisation plus stable du GPU.

Mécanisme : les centres de données dédiés à l'IA peuvent omettre le rapport UPS redondant et la conception d'alimentation électrique à faible densité des salles informatiques traditionnelles, et allouer plus de budget énergétique aux nœuds de calcul GPU. Les usines d'IA de Lambda adoptent une conception modulaire de 5 à 75 MW et prennent en charge le refroidissement liquide et le remplacement à chaud pour réduire les pertes de dissipation thermique.

Effet : à la même échelle de GPU, le PUE (efficacité énergétique) de Lambda est meilleur que celui des instances GPU cloud à usage général transformées à partir de centres de données traditionnels. Bien que les données réelles mesurées n'aient pas été rendues publiques, le gain d'efficacité théorique de l'architecture dédiée est de l'ordre de 15 à 25 %.

2. NVIDIA donne la priorité à la coopération en matière d'approvisionnement et d'ingénierie

Lambda est un partenaire NVIDIA Exemplar Cloud et a été nommé Partenaire NVIDIA de l'année pendant sept années consécutives. Cela signifie que Lambda bénéficie d'une priorité plus élevée et de remises sur volume plus importantes que les fournisseurs de cloud GPU de petite et moyenne taille dans l'allocation d'approvisionnement des derniers GPU (B200, GB300, VR200).

Effet : Lambda est capable de provisionner des instances cloud quelques semaines après la sortie de nouveaux GPU, alors que les petits fournisseurs devront peut-être attendre des mois. Il s'agit d'un gain de temps significatif pour les équipes qui doivent utiliser la dernière architecture pour l'analyse comparative ou l'adaptation de modèles dès que possible.

3. Optimisation profonde de l'architecture réseau

Lambda déploie trois solutions réseau simultanément dans le supercluster :

  • Domaine NVLink : connexion GPU directe au sein du nœud/armoire, utilisée pour la formation parallèle de modèles et les collectifs à forte intensité de communication, éliminant les goulots d'étranglement PCIe.
  • InfiniBand avec SHARP : réseau sans perte et à faible latence entre les armoires, prenant en charge RDMA et le routage adaptatif. SHARP regroupe les opérations de réduction au niveau du réseau pour réduire la charge du processeur des nœuds.
  • RoCE v2 : RDMA intégré à Ethernet, prenant en charge les scénarios d'expansion de cloud hybride et multi-cloud.

Scénarios applicables : le domaine NVLink est essentiel pour la formation multi-cartes sur une seule machine (comme le parallélisme tensoriel) ; InfiniBand est essentiel pour le parallélisme des données entre nœuds et le parallélisme des pipelines ; RoCE offre une option peu coûteuse pour les scénarios de cloud hybride élastique.

4. Cohérence de la pile Lambda

Lambda Stack est le « ciment logiciel » qui connecte tous les produits : les instances cloud sont préinstallées, les postes de travail locaux peuvent être installés manuellement et les clusters sont gérés de manière unifiée. Cela signifie que la « dérive de configuration » entre le contexte de développement et le contexte de production est minimisée.

Réduction des coûts cachés : la cohérence réduit le temps de débogage des « exécutions locales et des rapports d'erreurs dans le cloud ». Pour les projets de formation qui s'appuient sur un grand nombre de bibliothèques sous-jacentes (telles que des versions spécifiques de CUDA, Transformer Engine), cela peut permettre d'économiser des jours, voire des semaines, de travail d'adaptation au contexte.

Entrée d'utilisation de Lambda Labs

Lambda fournit des entrées d'utilisation multicouches, couvrant les exigences du côté C jusqu'au niveau de l'entreprise :

Entrée Objets applicables Chemins d'opération typiques
Tableau de bord Web (lambda.ai) Tous les utilisateurs Enregistrer un compte → Sélectionnez une instance/un cluster → Commencez en un clic → Connectez-vous via le navigateur SSH
API Cloud (docs.lambda.ai) Développeur/DevOps Acquisition de clés API → Automatisation des scripts pour créer/arrêter/redémarrer des instances → CI/CD intégré
Outils CLI Développeurs Installez Lambda CLI → lambda instance launch --type h100 --count 4 et autres commandes
Kubernetes géré Équipe Plateforme Soumettre la définition des ressources K8s → Lambda gère le plan de contrôle et le matériel → Opérations utilisateur via kubectl
Slurm hébergé Équipe HPC soumission de travaux par lots → Planificateur et nœuds de gestion Lambda → Exploitation et maintenance du matériel insensibles à l'utilisateur
Amarrage d'affaires Entreprise/Gouvernement Contacter l'équipe commerciale → Vérification du contexte POC → Signature de contrat long terme → Déploiement de cluster dédié

Étapes d'utilisation typiques (instance à la demande) :

  1. Visitez lambda.ai, créez un compte et complétez les paramètres du mode de paiement.
  2. Sélectionnez le modèle de GPU (tel que H100 SXM), la configuration (1×/2×/4×/8×) et la capacité de stockage dans le tableau de bord.
  3. Une fois l'instance créée, obtenez les informations de connexion SSH ; Lambda Stack est préinstallé, utilisez directement « nvidia-smi » pour confirmer l'état du GPU.
  4. Téléchargez l'ensemble de données et démarrez le script de formation. Surveillez l'utilisation du GPU, la mémoire et le réseau en temps réel via le tableau de bord ou l'API.
  5. Une fois la formation terminée, téléchargez le point de contrôle et détruisez l'instance pour arrêter la facturation. Le stockage persistant conserve les données et le même volume peut être monté sur l'instance suivante.

Scénarios typiques pour l'automatisation des API :

# API Lambda Cloud - Créer une instance (exemple Python, besoin de remplacer la clé API)
demandes d'importation

API_KEY = "<VOTRE_API_KEY>"
HEADERS = {"Autorisation": f"Bearer {API_KEY}", "Content-Type": "application/json"}

# Démarrer 2 × instances H100
charge utile = {
    "region": "us-east-1",
    "instance_type": "gpu_h100_80gb_2x",
    "name": "training-run-1",
    "ssh_key_names": ["ma-clé"]
}
resp = request.post("https://api.lambda.ai/v1/instances", headers=HEADERS, json=payload)
print(resp.json())

Prix des produits Lambda Labs

Le système de tarification de Lambda peut être divisé en trois niveaux en fonction des gammes de produits :

Instances à la demande (libre-service)

Facturé à l'heure par modèle de GPU, facturé à la minute, pas de consommation minimale, pas de frais de trafic sortant :

Modèle GPU Prix ​​actuel ($/GPU·h)
NVIDIA B200 SXM6 (180 Go) 6,69 $
NVIDIA H100 SXM (80 Go) 3,99 $
NVIDIA A100 SXM (80 Go) 2,79 $
NVIDIA A100 SXM (40 Go) 1,99 $
NVIDIA Tesla V100 (16 Go) 0,79 $

Cluster en 1 clic (semi-géré)

Clusters dédiés avec interconnexion InfiniBand, le prix est inversement lié au nombre de GPU et à la durée du bail :

Modèle GPU Quantité de GPU Durée du bail Prix ​​($/GPU·h)
HGX B200 16 2 semaines – 1 an 9,86 $
HGX B200 64 2 semaines – 1 an 9,36 $
HGX B200 256+ 2 semaines – 1 an 8,87 $
HGX B200 16+ 1 an+ Confirmation commerciale

Supergrappes et usines d'IA (Entreprise)

Il n’y a pas de prix public, merci de contacter l’équipe commerciale. Les éléments de tarification comprennent :

  • Nombre de GPU (4 000 à 165 000+)
  • Durée du bail (mois à années)
  • Portée du service géré (si l'exploitation et la maintenance de Kubernetes/Slurm sont incluses)
  • Complexité de l'architecture réseau et stockage

Chercheurs côté C/individuels : l'instance V100 a un coût d'entrée extrêmement faible de 0,79 $/h et peut être utilisée pour la vérification de prototypes et les réglages fins à petite échelle. Notez que V100 ne prend pas en charge FP8/BF16. Pour la formation de modèles modernes, ce n’est pas rentable. Il est recommandé d'utiliser au moins A100.

Équipe/Développeur : Instance H100 à la demande 3,99 $/GPU·h adaptée aux expériences flexibles ; Cluster B200 1-Click à 16 cartes 9,86 $/GPU·h adapté aux projets d'équipe avec des cycles clairs.

Niveau entreprise : la formation à grande échelle nécessite des contrats commerciaux. En prenant le contrat de plusieurs milliards de dollars de Microsoft comme limite inférieure de référence, on suppose que le prix unitaire des contrats à long terme à grande échelle est bien inférieur au prix public. Il est recommandé de prêter attention aux termes du contrat concernant les mises à niveau du modèle GPU, la compensation SLA de la fenêtre de maintenance et la protection des prix de renouvellement à l'expiration.

Scénarios d'application de Lambda Labs

Formation complète au processus d'un grand modèle de langage

Du réglage fin SFT/RLHF à nœud unique (à l'aide de 1 à 8 × instances H100) au pré-entraînement multi-nœuds (à l'aide de plus de 256 clusters ou superclusters GPU 1-Click), l'interconnexion InfiniBand de Lambda et le contexte cohérent de la pile Lambda éliminent le besoin d'adaptation du code à travers les contextes.

Considérations d'ingénierie : la sélection de 8 instances H100 pour l'entraînement à nœud unique peut répondre à la plupart des besoins de réglage fin (le réglage précis des paramètres complets de Llama 3 70B nécessite environ 8 × H100 et 80 Go de mémoire vidéo). La pré-formation d'un modèle de paramètres de plus de 100 B nécessite plus de 1 000 clusters GPU de niveau Superclusters. Les performances de Lambda sur MLPerf montrent que sa topologie de réseau prend bien en charge à la fois le parallélisme des modèles et le parallélisme des données.

Déploiement d'inférence élastique

Par rapport au H100, les instances B200 présentent une amélioration des performances revendiquée de 15 fois dans les scénarios d'inférence (grâce à une mémoire vidéo plus grande et à la prise en charge de FP4) et conviennent aux services d'inférence avec des exigences de débit élevé et de faible latence. Les instances Lambda sont facturées à la minute et peuvent être rapidement étendues pendant les pics de trafic et réduites pendant les creux. Avec l'API Cloud, une mise à l'échelle élastique automatique peut être réalisée.

Formation au modèle de conduite autonome

Le cas de Kodiak Robotics démontre l'application de Lambda dans la formation de bout en bout de modèles de conduite autonome : il doit traiter en continu des quantités massives de données d'exploitation routière, exécuter des simulations d'apprentissage par renforcement à grande échelle et rejouer la vérification après chaque mise à jour du modèle. Lambda prend en charge l'ensemble du processus sur un cluster à locataire unique, et la sécurité des données est garantie via SOC 2 et l'isolation physique.

Raisonnement et backtesting de l'IA financière

Hudson River Trading choisit Lambda pour faire évoluer son infrastructure de R&D quantitative, et les résultats de l'audit STAC-AI LANG6 fournissent une référence comparable des performances d'inférence NLP pour les scénarios financiers. La valeur clé de Lambda dans le secteur financier est la suivante : l'isolation physique à locataire unique répond aux exigences de conformité, tandis que Kubernetes géré réduit les charges d'exploitation et de maintenance informatiques.

Recherche académique et enseignement

Les laboratoires universitaires peuvent utiliser l'instance V100 à 0,79 $/h pour des expériences pédagogiques, et l'instance A100 à 2,79 $/h pour exécuter des projets de formation de niveau master/doctorat. Lambda ne nécessite pas de contrats à long terme, est facturé à l'heure et convient aux processus d'approvisionnement en recherche scientifique basés sur des systèmes d'approbation de projets et de budgets.

Groupes applicables de Lambda Labs

  • Chercheur au Frontier AI Lab : plus de 1 000 clusters GPU sont nécessaires pour former les modèles de base, et il existe un fort besoin d'interconnexion InfiniBand ainsi que d'exploitation et de maintenance gérées. Les superclusters de Lambda fournissent des environnements dédiés physiquement isolés pour éviter de rivaliser avec d'autres équipes pour la puissance de calcul.
  • Directeur technique d'une start-up d'IA : avant d'acheter du matériel GPU, utilisez des instances à la demande pour vérifier l'orientation du produit et le processus de formation, puis engagez-vous dans un budget de formation à grande échelle après avoir confirmé la convergence. Les clusters 1-Click offrent de meilleurs prix unitaires que ceux à la demande pour les formations de taille moyenne.
  • Équipe Enterprise AI Platform : responsable de la formation des modèles internes et de la construction de l'infrastructure d'inférence. Kubernetes/Slurm géré par Lambda réduit l'investissement des équipes de plateforme dans les opérations matérielles, tandis que la certification SOC 2 réduit les coûts d'audit de conformité.
  • Professeurs d'université et étudiants diplômés : disposent d'un budget limité mais ont besoin d'une puissance de calcul de niveau A100/H100 pour publier les meilleurs articles de conférence. Le modèle de facturation horaire de Lambda permet un contrôle flexible des dépenses pendant le cycle du projet, et les instances V100 sont utilisées comme options d'entrée pour réduire considérablement les coûts d'essais et d'erreurs.
  • Les fonds quantitatifs et les sociétés de technologie financière : ont des exigences strictes en matière d'isolement à locataire unique, d'audits de conformité et de réseaux à faible latence. L'architecture d'audit et d'isolation physique STAC-AI de Lambda est plus adaptée aux scénarios financiers que les cloud à usage général.

Ne convient pas aux foules et aux scènes :

  • Entreprises ayant besoin de services cloud « Family Bucket » : Lambda fournit uniquement la puissance de calcul GPU et ne fournit pas de services cloud standard tels que le stockage d'objets (doit être connecté à S3 séparément), la base de données gérée CDN, DNS, etc. Les équipes qui ont besoin d'un écosystème cloud complet doivent choisir AWS/Azure/GCP.
  • Passionnels individuels soucieux de leur budget : Le V100 à 0,79 $/h est toujours plus cher que l'achat d'un RTX 3090 d'occasion vous-même, et le V100 ne prend pas en charge BF16/FP8. Si vous essayez simplement une petite inférence de diffusion stable ou un didacticiel d'introduction à Keras, Colab Free Edition ou JarvisLabs sont des options plus économiques.
  • Utilisateurs non-utilisateurs de l'écosystème NVIDIA : Lambda est entièrement basé sur les GPU NVIDIA et ne prend pas en charge AMD ROCm ou Intel oneAPI. Si le workflow repose sur le GPU AMD, un détour est nécessaire.

Résumé et perspectives de Lambda Labs

Le positionnement de Lambda sur le marché du cloud GPU peut être résumé comme suit : pas un cloud général, uniquement la puissance de calcul de l'IA. Cette orientation lui permet d'acquérir une compétitivité différenciée dans l'optimisation approfondie de la charge de travail d'IA et la cohérence contextuelle de la chaîne d'approvisionnement de NVIDIA, mais elle est également clairement en retard par rapport à AWS/Azure/GCP en termes d'étendue des services.

Limites et incertitudes actuelles :

  • Les centres de données sont concentrés en Amérique du Nord, en Asie-Pacifique et en Europe, avec une couverture insuffisante, et il existe des angles morts régionaux pour les scénarios nécessitant un déploiement d'inférence mondiale à faible latence.
  • La concurrence sur le marché du cloud GPU continue de s'intensifier. Les produits concurrents tels que CoreWeave, RunPod et Vast.ai ont leurs propres stratégies d'élasticité des prix. Le B200 de Lambda, à 6,69 $/GPU·h, n'est pas le plus bas absolu.
  • En tant que société privée, Lambda ne divulgue pas de données financières détaillées, de taux de fidélisation de la clientèle ou d'utilisation réelle de ses clusters hyperscale. Les investisseurs sont tenus de faire preuve de diligence raisonnable en matière commerciale.
  • Le nom de domaine a été déplacé vers lambda.ai, mais le lambdalabs.com d'origine conserve toujours le saut. La recherche et les favoris doivent être mis à jour simultanément.

Évaluation des risques d'approvisionnement/d'adoption :

  • Chemin pilote : il est recommandé de commencer avec une instance H100 à la demande, en utilisant 3,99 $/GPU·h pour vérifier le processus de formation et les performances du réseau, et confirmer si les performances InfiniBand du cluster répondent aux attentes. Il est recommandé que la période de test soit de 2 à 4 semaines, en se concentrant sur la différence entre le débit d'entraînement réel (jetons/s) et le pic théorique.
  • Conditions étendues : évaluez la nécessité de passer à des clusters en 1 clic ou à des instances réservées lorsque les dépenses mensuelles en instances à la demande dépassent 10 000 à 20 000 $. Les clusters en 1 clic coûtent entre 8,87 et 9,86 $/GPU·h, bien que plus chers que les clusters à la demande à 3,99 $, incluent un réseau InfiniBand dédié et une orchestration gérée, ce qui représente un coût total de possession global potentiellement inférieur pour la formation multi-nœuds.
  • Éléments de vérification d'entreprise avant la signature : ① Conditions de mise à niveau du modèle GPU - si le GPU de nouvelle génération (tel que Rubin) peut être migré en douceur lors de son lancement pendant la période du contrat ; ② Fenêtre de maintenance et norme de compensation SLA ; ③ Plan d'évacuation des données - migration complète et sûre des données du cluster à locataire unique après la résiliation du contrat ; ④ Validation croisée du débit réel et du coût par jeton de Lambda et CoreWeave sur les mêmes tâches de formation.

Outils associés : Visage câlin, replicate

Informations de version

  • Mises à jour Lambda GPU Cloud :Service cloud itératif en continu sans numéro de version fixe.
  • Version du cluster Lambda Hyperplane :Il n’y a pas encore de date officielle précise.

Avis des utilisateurs

  • Chargement des avis...