LangKit Gratuit

-

LangKit est la boîte à outils d'indicateurs de texte LLM open source de WhyLabs (bibliothèque Python). Il fournit des indicateurs prêts à l'emploi tels que la qualité du texte, la pertinence du texte, la sécurité et la confidentialité, l'analyse des sentiments et de la toxicité, etc. Il est profondément intégré à la bibliothèque de journaux de données Whylogs et convient à l'observabilité et à la surveillance de la sécurité des entrées/sorties LLM liées à la production.

LangKit Interface du produit

LangKit

Paramètres et statistiques de base

LangKit est la boîte à outils de métriques de texte Python open source de WhyLabs, axée sur la fourniture de signaux d'observabilité structurés pour les interactions de grands modèles de langage (LLM) dans des contextes de production. Il ne s'agit pas d'une application autonome, mais d'une bibliothèque intégrée aux pipelines de données Python, profondément intégrée à la bibliothèque de journalisation de données open source Whylogs.

Projets Informations publiques
Positionnement officiel Boîte à outils de métriques de texte open source pour surveiller les modèles de langage
Formulaire de livraison Bibliothèque Python (paquet PyPI)
Licence Open Source Apache-2.0
Étoiles GitHub ~991
Fourches GitHub 72
Dernière version v0.0.35 (2024-11-07)
Sorties totales 35 versions
Plateformes prises en charge API Python (fonctionne avec Whylogs)
Modules de base Qualité du texte, pertinence du texte, sécurité et confidentialité, sentiment et toxicité

Limites de positionnement : LangKit n'est pas une plate-forme de surveillance de bout en bout, ni un pare-feu sécurisé. Il s'agit d'un ensemble d'UDF (fonctions définies par l'utilisateur) programmables qui génèrent des indicateurs structurés pour l'enregistrement par Whylogs, puis analysés par la plateforme WhyLabs ou des pipelines personnalisés. Sa valeur réside dans la conversion de textes LLM non structurés en indicateurs numériques quantifiables.

Référence de performances : le test de référence officiel montre que sur l'instance c5.xlarge, le mode « Light metrics » peut atteindre 2 335 chats/s, mais après avoir activé toutes les métriques LLM, il tombe à 8,2 chats/s ; sur g4dn.xlarge (GPU inclus), le mode métrique complet peut atteindre 1,79 chats/s. Ces données montrent qu'il existe une surcharge de calcul importante pour tous les indicateurs et qu'ils doivent être activés de manière sélective en fonction des scénarios lors du déploiement en production.

Reconnaissance des utilisateurs et du marché

Base communautaire : GitHub compte environ 991 étoiles, 72 forks, 10 contributeurs et 15 observateurs. La taille de la communauté est moyenne mais précise, se concentrant principalement sur les domaines de l'observabilité de l'IA et du LLMOps. 35 versions indiquent un investissement de maintenance continu dans le projet.

Contexte de l'industrie : LangKit est développé et open source par WhyLabs. WhyLabs était autrefois une startup leader dans le domaine de l'observabilité de l'IA, fondée par des équipes d'Amazon, Google, New Relic et d'autres sociétés. La société a cessé ses activités entre 2025 et 2026, mais la plate-forme complète est open source, et LangKit et Whylogs en tant que composants de base continueront d'exister sous forme open source.

Principe d'adoption : La valeur de LangKit dépend fortement de l'écosystème Whylogs. Si l'équipe utilise déjà Whylogs pour l'enregistrement des données, l'intégration de LangKit est presque gratuite ; sinon, un pipeline d'enregistrement de données supplémentaire doit être introduit, et cette partie du travail d'intégration doit être incluse dans l'évaluation.

Avantage de coût

LangKit lui-même est un projet open source sous licence Apache-2.0 dont l'utilisation est nulle.

  • C-side/Développeur personnel : Gratuit. Il peut être utilisé via pip install langkit[all], sans limite de quota et sans exigence de clé API. Les ressources informatiques sont supportées par des serveurs locaux ou autogérés.
  • API/Développeur : Gratuit. LangKit lui-même n'encourt pas de frais d'appel API, mais si vous utilisez des fonctions qui nécessitent des modèles externes (comme la détection d'hallucinations basée sur OpenAI), vous devez supporter vous-même les frais d'API correspondants.
  • Entreprise/Privé : auto-hébergement gratuit. Depuis que WhyLabs a cessé ses activités, les services d'hébergement pour la plateforme WhyLabs d'origine ne sont plus disponibles. Les entreprises peuvent uniquement emprunter le chemin auto-hébergé, intégrer LangKit dans leurs propres pipelines de données, utiliser des Whylogs pour enregistrer des indicateurs et créer leurs propres liens de visualisation/alerte. Les coûts cachés incluent : les heures de travail de développement intégré, les ressources informatiques GPU/CPU, le stockage, l'exploitation et la maintenance.

Coût caché : Les frais généraux de l'indicateur LLM complet ne sont pas négligeables. Les benchmarks officiels montrent que le débit du mode métrique complet sur les instances CPU n'est que de 0,28 chats/s (c5.xlarge), ce qui signifie que les scénarios à forte concurrence nécessitent des instances GPU ou activent sélectivement certaines métriques. Il est recommandé d'utiliser le cahier officiel pour effectuer des tests de résistance dans l'environnement cible avant l'adoption.

Fonctions principales

  • Qualité du texte : calcule automatiquement les scores de lisibilité, de complexité et de note. Convient pour surveiller si la sortie est trop obscure ou trop simple, aidant à détecter la dégradation du modèle ou la dérive du format.
  • Pertinence du texte : calculez le score de similarité entre l'invite et la réponse, et prenez en charge la comparaison de similarité des thèmes définis par l'utilisateur. Utilisé pour détecter si le modèle « répond à la mauvaise question » ou s’écarte du thème métier.
  • Sécurité et confidentialité : contient cinq sous-modules : modèles (nombre de correspondances régulières personnalisées), jailbreaks (similarité des attaques de jailbreak), injection rapide (similarité de l'injection rapide), hallucinations (vérification de la cohérence des réponses), refus (similarité des réponses de rejet). Cet ensemble de fonctionnalités peut mettre à niveau les signaux de sécurité des contrôles ponctuels manuels vers une analyse automatisée continue.
  • Sentiment et toxicité : fournit une analyse des sentiments et une analyse de la toxicité. Il convient aux scénarios tels que l'examen du contenu social et la surveillance du dialogue avec le service client qui nécessitent une sécurité du contenu en temps réel.
  • Détection PII : Un nouveau module de détection PII (Personally Identifiable Information) a été ajouté depuis la v0.0.29, qui peut identifier les informations sensibles dans le texte.

Vue d'expert : La valeur fondamentale de LangKit ne réside pas dans un seul indicateur, mais dans « l'effet synergique des combinaisons d'indicateurs ». Par exemple, l'activation simultanée des modules Qualité du texte + Pertinence + Sécurité vous permet de surveiller simultanément la dégradation de la qualité de sortie, les écarts de sujet, les attaques par injection et les risques d'hallucinations dans un seul pipeline de données sans avoir à basculer entre plusieurs outils. L'intégration approfondie avec Whylogs permet à tous les indicateurs d'être automatiquement alignés dans le même ensemble de profils de données, ce qui facilite la réalisation d'une analyse de corrélation des anomalies multidimensionnelles.

Evolution du modèle et de la version

LangKit suit le versioning sémantique et continue d'itérer avec v0.0.x comme ligne principale. Voici les nœuds de version clés :

Version principale

  • v0.0.35 (07/11/2024) : Correction du schéma de l'enregistreur dynamique, mise à jour de la logique de téléchargement opt-in du notebook, actuellement la dernière version stable.
  • v0.0.34 (2024-10-30) : mettez à niveau les dépendances vers Whylogs 1.5 pour maintenir la compatibilité avec les Whylogs en amont.
  • v0.0.33 (2024-08-12) : remplacez textstat par Whylabs-textstat auto-entretenu pour réduire le risque de dépendances externes.
  • v0.0.32 (2024-05-29) : Ajout de la prise en charge des modèles locaux, permettant aux modèles d'être exécutés localement au lieu de s'appuyer sur des API externes.
  • v0.0.31 (2024-03-06) : Ajout d'une option de modèle de détoxification configurable pour l'analyse de la toxicité, améliorant l'exposition aux erreurs dans la détection des hallucinations.
  • v0.0.30 (07/02/2024) : supprimez la dépendance faiss, mettez à niveau les intégrations vers la v2 et réduisez le volume et la complexité de l'installation.
  • v0.0.29 (2024-01-23) : Ajout du module de détection PII et du support émotionnel VADER.
  • v0.0.28 (2023-12-09) : prend en charge la double compatibilité du client OpenAI v0/v1 et ajoute la détection proactive des injections.
  • v0.0.27 (2023-11-28) : Ajout du benchmark CUDA du wrapper d'extraction de fonctionnalités.
  • v0.0.26 (2023-11-22) : prend en charge le contrôle de l'utilisation du GPU du modèle d'hébergement Azure OpenAI.

Caractéristiques des itérations : Le projet a duré environ un an de la v0.0.26 à la v0.0.35, en maintenant un rythme mensuel moyen de 1 à 2 versions. La première version s'est concentrée sur l'expansion fonctionnelle (module de sécurité PII, modèle local), puis sur la stabilité et la maintenance des dépendances. Après l'arrêt de WhyLabs, la fréquence des mises à jour du projet pourrait encore ralentir.

Avantages techniques

Mécanisme — Effet — Analyse de scénario :

  • Architecture UDF basée sur Whylogs : chaque module indicateur de LangKit est implémenté comme un ou plusieurs UDF Whylogs, qui sont automatiquement montés dans le pipeline de journaux Whylogs. Cela signifie que les utilisateurs n'ont pas besoin d'écrire manuellement la logique d'extraction de fonctionnalités. Il leur suffit d'importer le module et d'initialiser le schéma pour synchroniser les indicateurs de sortie pendant le processus d'enregistrement des données. Pour les équipes qui disposent déjà de l'intégration de Whylogs, ce mécanisme permet des améliorations de l'observabilité « zéro code supplémentaire ».
  • Détection de sécurité basée sur la similarité : les modules de sécurité tels que le jailbreak, l'injection rapide et le refus utilisent la similarité vectorielle pour correspondre aux modèles d'attaque/déni connus au lieu d'un moteur de règles. L’avantage de cette méthode est qu’elle peut être généralisée à des attaques variantes invisibles, mais l’inconvénient est qu’elle est sensible à la qualité du modèle d’intégration et présente des faux positifs. Pour les déploiements en production, il est recommandé de calibrer d'abord les seuils avec un ensemble de données de référence.
  • Chargement modulaire à la demande : les indicateurs de LangKit sont divisés en modules indépendants, et les utilisateurs installent et importent uniquement les fonctions requises pour éviter une surcharge de calcul inutile. Les configurations à trois niveaux officiellement fournies de « métriques légères », « métriques LLM » et « toutes les métriques » sont l'incarnation de cette conception : sur c5.xlarge, le mode léger (2 335 chats/s) est environ 8 300 fois plus rapide que le mode complet (0,28 chats/s).
  • Modèle local facultatif : à partir de la version 0.0.32, il est pris en charge pour exécuter le modèle de détection localement sans forcer la dépendance aux API externes. Ceci est essentiel pour les déploiements sensibles à la souveraineté des données ou hors ligne : les mesures de sécurité peuvent être calculées entièrement sans réseau externe.

Comment utiliser

Les informations pertinentes n'ont pas été rendues publiques, veuillez vous référer à la page officielle en temps réel.

Prix des produits

LangKit lui-même est entièrement gratuit et open source. Les niveaux de tarification sont les suivants :

Niveau Frais Descriptif
Bibliothèque Python Gratuit Licence Apache-2.0, aucune restriction d'utilisation
Ressources informatiques Propre responsabilité Le calcul de l'indicateur consomme des ressources CPU/GPU et les frais de service cloud sont supportés en fonction de l'utilisation réelle
Plateforme d'hébergement Indisponible La plateforme WhyLabs n'est plus opérationnelle, pas d'options d'hébergement commercial
Assistance entreprise Indisponible WhyLabs Inc. est arrêté et n'a pas de contrat de support commercial

Options suivantes : En raison de l'arrêt de la plateforme WhyLabs, les utilisateurs de LangKit ne peuvent actuellement l'utiliser que de manière auto-hébergée. La communauté pourrait lancer le projet ou créer de nouvelles solutions de visualisation basées sur les Whylogs à l'avenir. Lors de l’évaluation de l’adoption, vous devez confirmer que votre propre équipe a la capacité de maintenir ce lien open source.

Scénarios d'application

  • Surveillance de la production LLM : collectez en continu des indicateurs de qualité, de pertinence et de sécurité du texte d'invite/réponse dans l'environnement de production pour détecter la dégradation du modèle (réduction de la qualité de sortie), la dérive du sujet (réduction du score de pertinence) ou les entrées anormales (attaque par injection/jailbreak). Postes applicables : Ingénieur MLOps Développeur d'applications IA.
  • Audit de conformité de sécurité : activez les modules de détection de PII, de détection d'injection et de détection de jailbreak, et effectuez des analyses de sécurité automatisées sur les journaux d'interaction LLM. Convient aux scénarios de déploiement LLM dans les secteurs réglementés tels que les institutions financières et la santé. Objectif de vérification : l'équilibre entre le taux de faux positifs et le taux de rappel.
  • Contrôle de la qualité du contenu : analysez les résultats du modèle pour en vérifier la lisibilité, le sentiment et la toxicité afin de garantir que le contenu orienté utilisateur répond au ton de la marque et aux normes de sécurité. Il convient à des scénarios tels que le dialogue avec le service client, la génération de contenu sur les réseaux sociaux et la production de contenu éducatif.
  • Évaluation de l'ingénierie des mots d'invite : utilisez des indicateurs de pertinence du texte pour comparer la distance sémantique entre les différentes variantes d'invite et le résultat idéal pendant la phase de développement, et quantifier l'effet d'optimisation de l'invite. Points clés de vérification : le seuil de similarité doit être défini en fonction de la sémantique métier, plutôt que d'être unique.

Personnes concernées

  • MLOps/AI Infrastructure Engineer : L'équipe technique nécessaire pour créer des pipelines d'observabilité pour les applications LLM. LangKit fournit une extraction d'indicateurs standardisée pour réduire la duplication du travail dans les systèmes de surveillance auto-construits. Condition préalable : L'équipe possède déjà ou est prête à introduire des Whylogs.
  • AI Security Researcher : chercheurs qui doivent analyser la sécurité rapide par lots. Les modules d'injection/jailbreak/hallucination de LangKit fournissent des lignes de base de détection de similarité réutilisables. Scénarios inappropriés : scénarios nécessitant des règles personnalisées de haute précision ou une interception en temps réel. LangKit génère uniquement des indicateurs et n'effectue pas de blocage.
  • Développeur d'applications LLM : développeur qui crée un produit basé sur LLM et a besoin de savoir si le modèle se comporte anormalement. Le suivi de production peut être connecté à quelques codes Python. Scénarios inappropriés : Équipes avec des piles technologiques non Python (LangKit est une pure bibliothèque Python).
  • Personnes inappropriées : équipes qui ont besoin d'un panneau de surveillance visuelle sans code (LangKit ne fournit pas d'interface utilisateur et les indicateurs doivent être visualisés par eux-mêmes) ; les équipes qui ont besoin d'une passerelle d'interception de sécurité en temps réel (LangKit est un outil d'analyse des journaux plutôt qu'un pare-feu) ; les utilisateurs existants qui dépendent de la plateforme WhyLabs (la plateforme a été abandonnée et doit être migrée vers une solution auto-hébergée).

Résumé et Outlook

L’intérêt de LangKit est de fournir une couche d’extraction d’indicateurs standardisée et programmable pour le suivi de la production LLM. Il encapsule des signaux multidimensionnels tels que la qualité du texte, la pertinence, la sécurité et l'émotion dans Whylogs UDF. Les utilisateurs peuvent transformer les interactions LLM non structurées en données observables structurées avec seulement quelques lignes de code. La maturité technique du projet est démontrée par la licence Apache-2.0 et un record d'itérations de 35 versions.

Limites et incertitudes actuelles :

  • La société WhyLabs a cessé ses activités et le lien d'hébergement de la plateforme n'est pas valide. Il existe une incertitude quant au rythme de maintenance futur et à l'activité communautaire de LangKit. Il est recommandé de prêter attention aux enregistrements de commit de l'entrepôt GitHub au cours des trois derniers mois avant de l'adopter.
  • La surcharge de calcul des indicateurs complets est très élevée (<1 chat/sec sur les instances CPU). Le déploiement en production doit activer les modules de manière sélective en fonction des scénarios et planifier les ressources GPU.
  • LangKit fournit uniquement l'extraction d'indicateurs et n'inclut pas de fonctions de surveillance telles que la visualisation, les alarmes et les tableaux de bord. Il doit être construit par vous-même à partir des résultats de Whylogs.
  • Le module de sécurité est basé sur la correspondance de similarité et est sensible à la qualité du modèle embarqué. Le seuil doit être calibré avec les données réelles de l'environnement de production.

Évaluation des risques d'approvisionnement et d'adoption : LangKit convient aux équipes techniques Python qui utilisent déjà ou prévoient d'utiliser les Whylogs comme couche source de métriques du pipeline d'observabilité LLM. Trois points doivent être confirmés avant l'évaluation et l'adoption : (1) L'équipe a la capacité d'auto-héberger les pourquoi et de traiter les données de sortie du profil ; (2) La simultanéité du scénario cible est dans les limites du budget de performance du module sélectionné de LangKit (il est recommandé d'utiliser d'abord le benchmark officiel pour les tests de résistance) ; (3) Il existe une gestion des attentes raisonnables concernant le rythme de maintenance futur du projet. Pour les équipes qui ont besoin d’une plateforme de surveillance prête à l’emploi ou d’une pile technologique non Python, LangKit n’est actuellement pas un choix approprié.

Outils associés : , Curseur

Comment utiliser LangKit

LangKit est distribué sous forme de bibliothèque Python, installée via PyPI, et le point d'entrée est l'intégration du SDK avec Whylogs.

Installation :

pip install langkit[tous]

Pour une installation minimale (hors dépendances optionnelles telles que torche et transformateurs), utilisez :

pip installer le kit de langage

Utilisation de base :

importer des pourquoilogs comme pourquoi
depuis Langkit importer llm_metrics

#Initialiser le schéma de l'indicateur LLM
schéma = llm_metrics.init()

# Enregistrez une interaction invite/réponse et calculez automatiquement les indicateurs
résultats = pourquoi.log(
    {"prompt": "Qu'est-ce que l'apprentissage automatique", "response": "L'apprentissage automatique est..."},
    schéma=schéma
)

# Les résultats incluent des statistiques sur tous les indicateurs enregistrés tels que la qualité du texte, la pertinence et la sécurité.
profil = résultats.profile()

Activer des modules spécifiques sur demande :

depuis Langkit importer text_quality, sentiment

schéma = llm_metrics.init()
# Activer uniquement les modules de qualité du texte et d'analyse des sentiments
schéma = text_quality.init() # Indicateurs de lisibilité et de complexité du registre
schéma = sentiment.init() # Enregistrer les indicateurs de sentiment et de toxicité

Intégré dans le pipeline de production : la manière typique d'utiliser LangKit consiste à insérer un point de journal dans la chaîne d'appels LLM, à transmettre l'invite et la réponse dans Why.log(), puis à télécharger régulièrement le profil sur la plateforme WhyLabs (plan initial, la plateforme a été abandonnée) ou à l'écrire sur le stockage local pour une analyse ultérieure.

Entrée : le référentiel GitHub (https://github.com/whylabs/langkit) contient une documentation complète, une FAQ, des exemples de blocs-notes et une documentation sur les modules.

Informations de version

  • LangKit 0.0.35 :Corrigez le schéma de l'enregistreur dynamique et mettez à jour la logique de téléchargement opt-in du notebook.
  • LangKit 0.0.34 :Mettez à jour les dépendances vers Whylogs 1.5 pour résoudre les problèmes de compatibilité.
  • LangKit 0.0.33 :Textstat remplacé par Whylabs-textstat, image README mise à jour.
  • LangKit 0.0.32 :Ajout de la prise en charge des modèles locaux et de l'extrait de code textstat mis à jour.
  • LangKit 0.0.31 :Ajout de la prise en charge du modèle de détoxification configurable et amélioration de la gestion des erreurs en réponse à la détection d'hallucinations.
  • LangKit 0.0.30 :Supprimez la dépendance faiss et mettez à niveau les intégrations v2.

Avis des utilisateurs

  • Chargement des avis...