랭킷 무료

-

LangKit은 WhyLabs의 오픈 소스 LLM 텍스트 표시기 툴킷(Python 라이브러리)입니다. 텍스트 품질, 텍스트 관련성, 보안 및 개인 정보 보호, 감정 및 독성 분석 등과 같은 기본 지표를 제공합니다. Whylogs 데이터 로그 라이브러리와 긴밀하게 통합되어 있으며 프로덕션 바인딩 LLM 입력/출력의 관찰 가능성 및 보안 모니터링에 적합합니다.

랭킷 제품 인터페이스

랭킷

핵심 매개변수 및 통계

LangKit은 WhyLabs의 오픈 소스 Python 텍스트 측정 도구 키트로, 프로덕션 컨텍스트에서 LLM(대형 언어 모델) 상호 작용을 위한 구조화된 관찰 가능성 신호를 제공하는 데 중점을 둡니다. 이는 독립형 애플리케이션이 아니라 Python 데이터 파이프라인에 내장된 라이브러리이며 오픈 소스 데이터 로깅 라이브러리 Whylogs와 긴밀하게 통합되어 있습니다.

프로젝트 공공정보
공식 포지셔닝 언어 모델 모니터링을 위한 오픈 소스 텍스트 측정 도구 키트
배송 형태 Python 라이브러리(PyPI 패키지)
오픈 소스 라이센스 아파치-2.0
GitHub 스타 ~991
GitHub 포크 72
최신 버전 v0.0.35 (2024-11-07)
총 릴리스 버전 35개
지원되는 플랫폼 Python API(whylogs와 함께 작동)
핵심 모듈 텍스트 품질, 텍스트 관련성, 보안 및 개인 정보 보호, 감정 및 독성

포지셔닝 경계: LangKit은 엔드투엔드 모니터링 플랫폼도 아니고 보안 방화벽도 아닙니다. Whylog 기록을 위해 구조화된 지표를 출력한 후 WhyLabs 플랫폼 또는 사용자 정의 파이프라인으로 분석하는 프로그래밍 가능한 UDF(사용자 정의 함수) 세트입니다. 그 가치는 구조화되지 않은 LLM 텍스트를 정량화 가능한 숫자 지표로 변환하는 데 있습니다.

성능 참조: 공식 벤치마크 테스트에 따르면 c5.xlarge 인스턴스에서 "Lightmetrics" 모드는 2335채팅/초에 도달할 수 있지만 모든 LLM 지표를 활성화한 후에는 8.2채팅/초로 떨어집니다. g4dn.xlarge(GPU 포함)에서 전체 메트릭 모드는 초당 1.79개의 채팅에 도달할 수 있습니다. 이 데이터는 모든 지표에 상당한 컴퓨팅 오버헤드가 있으며 프로덕션 배포 중 시나리오에 따라 선택적으로 활성화해야 함을 보여줍니다.

사용자 및 시장 인지도

커뮤니티 기반: GitHub에는 약 991명의 스타, 72개의 포크, 10명의 기여자 및 15명의 관찰자가 있습니다. 커뮤니티 규모는 중간이지만 정확하며 주로 AI 관찰 가능성 및 LLMOps 분야에 중점을 둡니다. 35개의 릴리스는 프로젝트에 대한 지속적인 유지 관리 투자를 나타냅니다.

업계 배경: LangKit은 WhyLabs에서 개발하고 오픈 소스로 제공합니다. WhyLabs는 한때 Amazon, Google, New Relic 및 기타 회사의 팀이 설립한 AI 관찰 트랙의 선도적인 스타트업이었습니다. 회사는 2025년에서 2026년 사이에 운영을 중단했지만 전체 플랫폼은 오픈 소스였으며 핵심 구성 요소인 LangKit 및 Whylog는 오픈 소스 형태로 계속 존재할 것입니다.

채택 전제: LangKit의 가치는 Whylogs 생태계에 크게 의존합니다. 팀이 이미 데이터 로깅을 위해 Whylog를 사용하고 있다면 LangKit을 통합하는 데 드는 비용이 거의 없습니다. 그렇지 않으면 추가 데이터 로깅 파이프라인을 도입해야 하며 통합 작업의 이 부분을 평가에 포함해야 합니다.

비용 이점

LangKit 자체는 사용 비용이 전혀 들지 않는 Apache-2.0 라이선스 오픈 소스 프로젝트입니다.

  • C측/개인 개발자: 무료. 할당량 제한이나 API 키 요구 사항 없이 pip install langkit[all]을 통해 사용할 수 있습니다. 컴퓨팅 리소스는 로컬 또는 자체 관리 서버에서 부담합니다.
  • API/개발자: 무료. LangKit 자체에서는 API 호출 비용이 발생하지 않지만, 외부 모델이 필요한 기능(예: OpenAI 기반 환각 감지)을 사용하는 경우 해당 API 비용을 직접 부담해야 합니다.
  • 기업/개인: 무료 자체 호스팅. WhyLabs의 운영이 중단됨에 따라 원래 WhyLabs 플랫폼에 대한 호스팅 서비스를 더 이상 사용할 수 없습니다. 기업은 자체 호스팅 경로만 취하고, LangKit을 자체 데이터 파이프라인에 통합하고, Whylog를 사용하여 지표를 기록하고, 자체 시각화/경고 링크를 구축할 수 있습니다. 숨겨진 비용에는 통합 개발 작업 시간, GPU/CPU 컴퓨팅 리소스, 저장, 운영 및 유지 관리가 포함됩니다.

숨겨진 비용: 전체 LLM 지표의 오버헤드는 무시할 수 없습니다. 공식 벤치마크에 따르면 CPU 인스턴스에서 전체 메트릭 모드의 처리량은 0.28 chats/sec(c5.xlarge)에 불과합니다. 이는 높은 동시성 시나리오에는 GPU 인스턴스가 필요하거나 일부 메트릭을 선택적으로 활성화해야 함을 의미합니다. 채택 전 대상 환경에서 스트레스 테스트를 위해 공식 노트북을 사용하는 것이 좋습니다.

주요 기능

  • 텍스트 품질: 가독성 점수, 복잡성 및 등급 점수를 자동으로 계산합니다. 출력이 너무 모호하거나 너무 단순한지 모니터링하는 데 적합하여 모델 저하 또는 형식 드리프트를 감지하는 데 도움이 됩니다.
  • 텍스트 관련성: 프롬프트와 응답 간의 유사성 점수를 계산하고, 사용자가 정의한 테마의 유사성 비교를 지원합니다. 모델이 "잘못된 질문에 대답"하는지 또는 비즈니스 주제에서 벗어나는지 여부를 감지하는 데 사용됩니다.
  • 보안 및 개인 정보 보호: 패턴(사용자 정의 일반 일치 횟수), 탈옥(탈옥 공격 유사성), 프롬프트 주입(즉시 주입 유사성), 환각(응답 일관성 확인), 거부(거부 응답 유사성) 등 5개의 하위 모듈이 포함되어 있습니다. 이 기능 세트는 보안 신호를 수동 즉석 검사에서 지속적인 자동 검사로 업그레이드할 수 있습니다.
  • 감정 및 독성: 감정 분석 및 독성 분석을 제공합니다. 실시간 콘텐츠 보안이 필요한 소셜 콘텐츠 검토, 고객 서비스 대화 모니터링 등의 시나리오에 적합합니다.
  • PII 감지: v0.0.29부터 텍스트의 민감한 정보를 식별할 수 있는 새로운 PII(개인 식별 정보) 감지 모듈이 추가되었습니다.

전문가의 견해: LangKit의 핵심 가치는 단일 지표가 아니라 "지표 조합의 시너지 효과"에 있습니다. 예를 들어 텍스트 품질 + 관련성 + 보안 모듈을 동시에 활성화하면 여러 도구 간에 전환할 필요 없이 단일 데이터 파이프라인에서 출력 품질 저하, 주제 편차, 주입 공격 및 환각 위험을 동시에 모니터링할 수 있습니다. Whylogs와의 긴밀한 통합을 통해 모든 지표를 동일한 데이터 프로필 세트에 자동으로 정렬할 수 있으므로 교차 차원 이상 상관 관계 분석을 더 쉽게 수행할 수 있습니다.

모델 및 버전의 진화

LangKit은 의미론적 버전 관리를 따르며 v0.0.x를 기본 라인으로 계속 반복합니다. 다음은 주요 릴리스 노드입니다.

메인라인 출시

  • v0.0.35(2024-11-07): 롤링 로거 스키마 수정, 노트북 옵트인 업로드 로직 업데이트, 현재 최신 안정 버전입니다.
  • v0.0.34(2024-10-30): 업스트림 Whylogs와의 호환성을 유지하기 위해 종속성을 Whylogs 1.5로 업그레이드합니다.
  • v0.0.33(2024-08-12): textstat를 자체 유지 관리되는 Whylabs-textstat로 대체하여 외부 종속성의 위험을 줄입니다.
  • v0.0.32(2024-05-29): 로컬 모델 지원이 추가되어 외부 API에 의존하지 않고 모델을 로컬에서 실행할 수 있습니다.
  • v0.0.31(2024-03-06): 독성 분석을 위한 구성 가능한 해독 모델 옵션이 추가되어 환각 감지 시 오류 노출이 개선되었습니다.
  • v0.0.30(2024-02-07): faiss 종속성을 제거하고, 임베딩을 v2로 업그레이드하고, 설치 볼륨과 복잡성을 줄입니다.
  • v0.0.29(2024-01-23): PII 감지 모듈 및 VADER 감정 지원이 추가되었습니다.
  • v0.0.28(2023-12-09): OpenAI 클라이언트 v0/v1 이중 호환성을 지원하고 사전 예방적 주입 감지를 추가합니다.
  • v0.0.27(2023-11-28): 기능 추출 래퍼 CUDA 벤치마크가 추가되었습니다.
  • v0.0.26(2023-11-22): Azure OpenAI 호스팅 모델 GPU 사용량 제어를 지원합니다.

반복 특성: 프로젝트는 v0.0.26에서 v0.0.35까지 약 1년이 걸렸으며, 월 평균 1~2개 버전의 리듬을 유지했습니다. 초기 버전은 기능 확장(보안 모듈 PII, 로컬 모델)에 중점을 두고 이후에는 안정성 및 종속성 유지 관리에 중점을 두었습니다. WhyLabs가 중단되면 프로젝트 업데이트 빈도가 더욱 느려질 수 있습니다.

기술적인 장점

메커니즘 — 효과 — 시나리오 분석:

  • Whylogs 기반 UDF 아키텍처 : LangKit의 각 표시기 모듈은 하나 이상의 Whylogs UDF로 구현되며, 이는 Whylogs 로그 파이프라인에 자동으로 마운트됩니다. 이는 사용자가 특징 추출 논리를 수동으로 작성할 필요가 없음을 의미합니다. 데이터 로깅 프로세스 중에 출력 표시기를 동기화하려면 모듈을 가져오고 스키마를 초기화하기만 하면 됩니다. 이미 Whylogs 통합을 갖춘 팀의 경우 이 메커니즘을 사용하면 "추가 코드 없음" 관찰 가능성 향상이 가능합니다.
  • 유사성 기반 보안 탐지: 탈옥, 프롬프트 주입, 거부와 같은 보안 모듈은 규칙 엔진 대신 알려진 공격/거부 패턴을 일치시키기 위해 벡터 유사성을 사용합니다. 이 방법의 장점은 보이지 않는 변종 공격으로 일반화할 수 있다는 점이지만, 임베딩 모델의 품질에 민감하고 오탐(false positive)이 있다는 단점이 있습니다. 프로덕션 배포의 경우 먼저 벤치마크 데이터 세트를 사용하여 임계값을 보정하는 것이 좋습니다.
  • 모듈형 주문형 로딩: LangKit의 표시기는 독립적인 모듈로 분할되어 있으며 사용자는 불필요한 컴퓨팅 오버헤드를 피하기 위해 필요한 기능만 설치하고 가져옵니다. 공식적으로 제공되는 "라이트 메트릭", "LLM 메트릭" 및 "모든 메트릭"의 3단계 구성은 이 디자인의 구현입니다. c5.xlarge에서 라이트 모드(2335채팅/초)는 전체 모드(0.28채팅/초)보다 약 8300배 빠릅니다.
  • 로컬 모델 선택 사항: v0.0.32부터 외부 API에 대한 의존성을 강요하지 않고 로컬에서 감지 모델을 실행할 수 있도록 지원됩니다. 이는 데이터 주권에 민감하거나 경계가 제한된 오프라인 배포에 매우 중요합니다. 보안 지표는 외부 네트워크 없이도 완전히 계산될 수 있습니다.

사용방법

관련 내용은 아직 공개되지 않았으니, 공식 실시간 페이지를 참고해주시기 바랍니다.

제품 가격

LangKit 자체는 완전 무료이며 오픈 소스입니다. 가격 책정 계층은 다음과 같습니다.

계층 수수료 설명
파이썬 라이브러리 무료 Apache-2.0 라이센스, 사용 제한 없음
컴퓨팅 자원 자신의 책임 지표 계산에는 CPU/GPU 자원이 소모되며, 클라우드 서비스 요금은 실제 사용량에 따라 부담
호스팅 플랫폼 이용 불가 WhyLabs 플랫폼은 더 이상 운영되지 않으며 상업용 호스팅 옵션도 없습니다
기업 지원 이용 불가 WhyLabs Inc.는 중단되었으며 상업적 지원 계약도 없습니다

다음 옵션: WhyLabs 플랫폼 종료로 인해 LangKit 사용자는 현재 자체 호스팅 방식으로만 사용할 수 있습니다. 커뮤니티는 향후 Whylog를 기반으로 프로젝트를 포크하거나 새로운 시각화 솔루션을 구축할 수 있습니다. 채택을 평가할 때 자신의 팀이 이 오픈 소스 링크를 유지할 수 있는지 확인해야 합니다.

애플리케이션 시나리오

  • LLM 프로덕션 모니터링: 프로덕션 환경에서 텍스트 품질, 관련성, 프롬프트/응답의 보안 지표를 지속적으로 수집하여 모델 저하(출력 품질 저하), 주제 드리프트(관련성 점수 감소) 또는 비정상적인 입력(삽입/탈옥 공격)을 감지합니다. 지원 직위: MLOps 엔지니어 AI 애플리케이션 개발자.
  • 보안 규정 준수 감사: PII 감지, 주입 감지 및 탈옥 감지 모듈을 활성화하고 LLM 상호 작용 로그에 대한 자동화된 보안 검색을 수행합니다. 금융 기관, 의료 등 규제 산업의 LLM 배포 시나리오에 적합합니다. 검증 초점: 거짓양성률과 재현율 사이의 균형.
  • 콘텐츠 품질 관리: 모델 출력의 가독성, 감정, 독성을 분석하여 사용자 중심 콘텐츠가 브랜드 톤 및 안전 표준을 충족하는지 확인합니다. 고객 서비스 대화, 소셜 미디어 콘텐츠 생성, 교육 콘텐츠 제작 등의 시나리오에 적합합니다.
  • 프롬프트 단어 엔지니어링 평가: 텍스트 관련성 지표를 사용하여 개발 단계에서 다양한 프롬프트 변형과 이상적인 출력 간의 의미 거리를 비교하고 프롬프트 최적화 효과를 정량화합니다. 검증의 핵심 포인트: 유사성 임계값은 일률적으로 적용하기보다는 비즈니스 의미론에 따라 정의되어야 합니다.

해당자

  • MLOps/AI 인프라 엔지니어: LLM 애플리케이션을 위한 관찰 파이프라인을 구축하는 데 필요한 기술 팀입니다. LangKit은 자체 구축된 모니터링 시스템에서 작업 중복을 줄이기 위해 표준화된 지표 추출을 제공합니다. 전제 조건: 팀이 이미 Whylog를 보유하고 있거나 도입할 의향이 있습니다.
  • AI 보안 연구원: 신속한 보안을 일괄적으로 분석해야 하는 연구원입니다. LangKit의 주입/탈옥/환각 모듈은 재사용 가능한 유사성 탐지 기준선을 제공합니다. 부적합한 시나리오: 고정밀 맞춤형 규칙이나 실시간 차단이 필요한 시나리오. LangKit은 표시기만 생성하고 차단을 수행하지 않습니다.
  • LLM 애플리케이션 개발자: LLM 기반 제품을 구축 중이며 모델이 비정상적으로 작동하는지 확인해야 하는 개발자입니다. 생산 모니터링은 몇 개의 Python 코드로 연결될 수 있습니다. 적합하지 않은 시나리오: Python이 아닌 기술 스택을 갖춘 팀(LangKit은 순수 Python 라이브러리)
  • 부적합한 사람: 제로 코드 시각적 모니터링 패널이 필요한 팀(LangKit은 UI를 제공하지 않으며 지표를 자체적으로 시각화해야 함) 실시간 보안 차단 게이트웨이가 필요한 팀(LangKit은 방화벽이 아닌 로그 분석 도구입니다) WhyLabs 플랫폼에 의존하는 기존 사용자(플랫폼은 중단되었으며 자체 호스팅 솔루션으로 마이그레이션해야 함)

요약 및 전망

LangKit의 가치는 LLM 생산 모니터링을 위한 표준화되고 프로그래밍 가능한 지표 추출 레이어를 제공하는 것입니다. 텍스트 품질, 관련성, 안전, 감정과 같은 다차원 신호를 Whylogs UDF에 캡슐화합니다. 사용자는 단 몇 줄의 코드만으로 구조화되지 않은 LLM 상호 작용을 구조화되고 관찰 가능한 데이터로 변환할 수 있습니다. 프로젝트의 엔지니어링 성숙도는 Apache-2.0 라이센스와 35번의 릴리스 반복 기록으로 입증됩니다.

현재 제한 사항 및 불확실성:

  • WhyLabs 회사는 운영을 중단했으며 플랫폼 호스팅 링크가 유효하지 않습니다. LangKit의 향후 유지 관리 리듬과 커뮤니티 활동에 대해서는 불확실성이 있습니다. 채택하기 전에 지난 3개월 동안 GitHub 웨어하우스의 커밋 기록에 주의하는 것이 좋습니다.
  • 전체 표시기의 계산 오버헤드가 매우 높습니다(CPU 인스턴스에서 <1 chat/sec). 프로덕션 배포는 시나리오 및 계획 GPU 리소스에 따라 모듈을 선택적으로 활성화해야 합니다.
  • LangKit은 지표 추출만 제공하며 시각화, 알람, 대시보드 등의 모니터링 기능은 포함하지 않습니다. Whylogs 출력을 기반으로 직접 작성해야 합니다.
  • 보안 모듈은 유사성 매칭을 기반으로 하며 임베디드 모델의 품질에 민감합니다. 임계값은 프로덕션 환경의 실제 데이터로 보정되어야 합니다.

조달 및 채택 위험 평가: LangKit은 LLM 관찰 가능성 파이프라인의 메트릭 소스 계층으로 Whylog를 이미 사용하고 있거나 사용할 계획을 갖고 있는 Python 기술 팀에 적합합니다. 평가 및 채택 전에 세 가지 사항을 확인해야 합니다. (1) 팀은 이유 로그를 자체 호스팅하고 출력 프로필 데이터를 처리할 수 있습니다. (2) 대상 시나리오의 동시성은 LangKit이 선택한 모듈의 성능 예산 내에 있습니다(먼저 스트레스 테스트를 위해 공식 벤치마크를 사용하는 것이 좋습니다). (3) 프로젝트의 향후 유지관리 리듬에 대한 합리적인 기대 관리가 있습니다. 즉시 사용 가능한 모니터링 플랫폼이나 Python이 아닌 기술 스택이 필요한 팀의 경우 LangKit은 현재 적합한 선택이 아닙니다.

관련 도구: , 커서

LangKit 사용 방법

LangKit은 Python 라이브러리로 배포되고 PyPI를 통해 설치되며 진입점은 Whylogs와 SDK 통합입니다.

설치:

``배쉬 pip 설치 langkit[전체]


최소 설치(토치 및 변압기와 같은 선택적 종속성 제외)의 경우 다음을 사용합니다.

``배쉬
pip 설치 langkit

기본 사용법:

``파이썬 이유 로그를 왜 가져오기 langkit에서 llm_metrics 가져오기

LLM 표시기 스키마 초기화

스키마 = llm_metrics.init()

프롬프트/응답 상호작용을 기록하고 지표를 자동으로 계산합니다.

결과 = 이유.로그( {"prompt": "기계 학습이란 무엇입니까,", "response": "기계 학습은..."}, 스키마=스키마 )

결과에는 텍스트 품질, 관련성, 보안 등 등록된 모든 지표에 대한 통계가 포함됩니다.

프로필 = 결과.프로필()


**요청 시 특정 모듈 활성화**:

``파이썬
langkit에서 text_quality, 감정 가져오기

스키마 = llm_metrics.init()
# 텍스트 품질 및 감정 분석 모듈만 활성화합니다.
schema = text_quality.init() # 가독성 및 복잡성 표시기 등록
schema = emotion.init() # 감정 및 독성 지표 등록

프로덕션 파이프라인에 통합됨: LangKit을 사용하는 일반적인 방법은 LLM 호출 체인에 로그 지점을 삽입하고 프롬프트와 응답을 Why.log()에 전달한 다음 정기적으로 프로필을 WhyLabs 플랫폼(원래 계획, 플랫폼은 중단됨)에 업로드하거나 후속 분석을 위해 로컬 저장소에 기록하는 것입니다.

입구: GitHub 저장소(https://github.com/whylabs/langkit)에는 전체 문서 FAQ, 샘플 노트북 및 모듈 문서가 포함되어 있습니다.

버전 정보

  • 랭킷 0.0.35 :롤링 로거 스키마를 수정하고 노트북의 선택 업로드 논리를 업데이트하세요.
  • 랭킷 0.0.34 :호환성 문제를 해결하려면 종속성을 Whylogs 1.5로 업데이트하세요.
  • 랭킷 0.0.33 :textstat를 Whylabs-textstat로 대체하고 README 이미지를 업데이트했습니다.
  • 랭킷 0.0.32 :로컬 모델 지원이 추가되고 textstat 코드 조각이 업데이트되었습니다.
  • 랭킷 0.0.31 :구성 가능한 해독 모델 지원이 추가되고 환각 감지에 대한 응답으로 오류 처리가 개선되었습니다.
  • 랭킷 0.0.30 :faiss 종속성을 제거하고 임베딩 v2를 업그레이드합니다.

사용자 후기

  • 후기를 불러오는 중...