대부분 AI
무료
대부분 AI는 오스트리아에서 시작된 오픈 소스 합성 데이터 플랫폼으로 SDK와 데이터 인텔리전스 플랫폼이라는 두 가지 전달 형식을 제공합니다. 코어는 TabularARGN 심층 생성 아키텍처를 기반으로 하며 테이블 및 텍스트 데이터의 교육, 생성 및 품질 검증을 지원합니다. 2026년 6월 Syntho에 인수되었으며 현재 "MOSTLY AI, powered by Syntho"라는 브랜드로 운영되고 있습니다.
MostlyAI의 합성 데이터 플랫폼
핵심 매개변수 및 통계
| 매개변수 | 가치 |
|---|---|
| 제품 포지셔닝 | 오픈소스 합성 데이터 생성 플랫폼 |
| 배송 형태 | Python SDK(오픈소스) + 데이터 인텔리전스 플랫폼(엔터프라이즈 수준) |
| 오픈 소스 라이센스 | 아파치 2.0(SDK) |
| 핵심 아키텍처 | TabularARGN(심층 생성 모델) |
| 지원되는 데이터 유형 | 테이블(단일 테이블/다중 테이블/시계열), 텍스트 |
| 지원되는 플랫폼 | 웹(플랫폼), API, 데스크톱(SDK는 로컬에서 실행됨) |
| GitHub 스타 | ~784 |
| GitHub 포크 | ~68 |
| 총 릴리스 | 116개 릴리스 |
| 최신 버전 | 6.1.1(2026-05-08) |
| 소속 장소 | 오스트리아(AT) |
| 현재 운영자 | Syntho(네덜란드, 2026년 6월 인수) |
대부분 AI는 '합성 데이터의 민주화'를 핵심 개념으로 삼아 기업 데이터 과학자부터 일반 개발자까지 데이터 생성 역량을 확장한다. 오픈 소스 SDK는 기본 Python 도구 체인을 제공하는 반면, 엔터프라이즈 플랫폼은 시각적 데이터 탐색, 협업 및 공유 기능을 제공합니다. 두 가지 양식은 개인 실험부터 기업 수준 규정 준수 배포까지 모든 시나리오를 다룹니다.
사용자 및 시장 인지도
- 기업 고객: 공개 사례에는 Swiss Post(고객 데이터 가용성을 11%에서 100%로 증가), Erste Group(Databricks 컨텍스트에서 합성 데이터를 사용한 모델 개발 가속화), AWS(고객 클라우드 마이그레이션에서 데이터 잠금 해제용), Databricks(클린룸 산업 간 데이터 협업용)가 포함됩니다.
- 금융 및 보험: JPMorgan은 합성 데이터 샌드박스를 사용하여 제3자 POC를 가속화합니다. Anthem은 합성 데이터를 사용하여 사기를 탐지하고 서비스를 맞춤화합니다. Telefónica는 분석을 위해 합성 고객 데이터를 사용합니다.
- 오픈 소스 커뮤니티: GitHub 784개의 별, 68개의 포크, 116개의 릴리스, 20명의 기여자, PyPI 다운로드가 계속 증가하고 있습니다. 이 프로젝트는 Apache 2.0 라이센스에 따라 운영되며 커뮤니티 기여를 허용합니다.
- 업계 인정: Gartner의 합성 데이터 대표 공급업체로 등재되었습니다. Gartner는 “2030년까지 AI 및 분석 프로젝트 개발에 사용되는 데이터의 대부분이 종합적으로 생성될 것”이라고 예측합니다.
비용 이점
C 측/개인 개발자: 오픈 소스 SDK는 완전히 무료이며(Apache 2.0 라이센스) pip/uv mostlyai[local]을 통해 설치하여 로컬 CPU/GPU에서 로컬로 실행할 수 있습니다. 개인 학습, 실험, 프로토타입 개발에 대한 명시적인 비용은 없으며 로컬 컴퓨팅 리소스 비용만 부담하면 됩니다.
API/개발자: SDK는 LOCAL 모드(로컬 교육 추론) 및 CLIENT 모드(원격 SDK 엔드포인트에 연결)를 지원합니다. CLIENT 모드 및 플랫폼 API에 대한 구체적인 청구 방법은 공개되지 않습니다. 견적을 받으려면 Syntho Business에 문의해야 합니다. PyPI 패키지 자체는 무료이지만 원격 엔드포인트를 사용하면 플랫폼 리소스 소비가 발생합니다.
엔터프라이즈/프라이빗: 엔터프라이즈급 데이터 인텔리전스 플랫폼은 데이터 볼륨, 노드 수, 사용자 수 및 지원 수준에 따른 비용으로 Kubernetes/OpenShift 민영화 배포를 지원합니다. 공식적인 공개 가격표는 없으며 사업 계약이 우선합니다. 오픈 소스 SDK는 기업 인트라넷에 오프라인으로 배포할 수도 있지만 Hugging Face 모델을 다운로드하려면 오프라인 환경에서 수동으로 파일을 전송해야 합니다.
숨겨진 비용: 대규모 언어 모델을 교육하려면 GPU 리소스가 필요합니다(공식적으로 LLM 미세 조정 추론을 위해 최신 GPU를 권장함). 테이블 형식 데이터 교육은 CPU에서 효율적으로 실행될 수 있습니다. 엔터프라이즈 배포에서는 자체 Kubernetes 인프라를 유지 관리해야 합니다.
주요 기능
-
AI가 합성 데이터 생성: TabularARGN 심층 생성 모델을 기반으로 실제 샘플 데이터로부터 통계 분포 및 상관 구조를 학습하고, 일관된 통계 특성을 갖는 합성 데이터를 생성합니다. 단일 테이블, 다중 테이블 관계, 시계열 데이터 및 텍스트 데이터를 지원합니다. 품질 보증 보고서(Model Insight Report)가 자동으로 첨부되어 충실도 및 개인정보 보안을 검증합니다.
-
AI Assistant: 코드 작성 없이 생산 데이터에 대한 탐색 분석, 추세 모니터링, 패턴 발견을 수행할 수 있는 자연어 기반 데이터 분석 도우미입니다. 하단 레이어는 비즈니스 분석가에게 적합한 Python 코드를 자동으로 생성하고 실행합니다.
-
모의 데이터 시뮬레이션 데이터: 실제 샘플 없이도 규칙과 무작위성을 기반으로 시뮬레이션 데이터를 생성합니다. 상황별 데모 시연, 프로토타입 테스트 및 기타 시나리오 개발에 적합합니다. 모의 데이터는 순수 규칙 도구보다 더 현실적인 상황별 데이터를 생성할 수 있습니다.
-
시뮬레이션된 데이터 시나리오 추론: 실제 또는 합성 데이터를 기반으로 모델을 만들어 극단적 사례, 미래 시나리오 및 "가상" 조건을 추론합니다. 스트레스 테스트, 전략 검증 및 알고리즘 견고성 평가에 적합합니다.
-
합성 데이터 SDK: Python 툴킷은
mostly.train(),mostly.generate(),mostly.probe(),mostly.connect()등 4가지 핵심 API를 제공합니다. GPU/CPU 훈련, 차등 개인 정보 보호, 조건부 샘플링, 공정성 제어, 온도 조정 등과 같은 고급 옵션을 지원합니다. 플랫폼 내에서 생성기를 내보내고 공유할 수 있습니다.
모델 및 버전의 진화
메인라인 반복
대부분 AI의 오픈 소스 SDK는 2023년 처음 출시된 이후 플랫폼 중심에서 기본 우선으로 아키텍처 진화를 거쳤습니다. 주요 출시 이정표는 다음과 같습니다.
-
2023년 - v1.0(초기 오픈 소스): TabularARGN 아키텍처를 기반으로 하는 최초의 오픈 소스 버전으로 단일 테이블/다중 테이블 합성 데이터 생성 및 품질 보고를 지원합니다. Apache 2.0 라이선스에 따라 라이선스가 부여됩니다.
-
2025년 4분기 - v5.9.0: OAuth2 통합 지원이 추가되고 외부 데이터 소스에 대한 연결이 개선되었습니다.
-
2026 Q1 - v5.10.0: 생성된 데이터가 특정 열 간 관계 제약 조건을 준수할 수 있도록 비즈니스 규칙 제약 시스템(Inequality, FixCombinations)을 도입합니다. 엔진을 2.4, PyTorch 2.9.1로 업그레이드했습니다.
-
2026년 2분기 - v6.0.0: 주요 아키텍처 리팩터링 - SDK는 완전히 네이티브 우선이며 플랫폼 전용 인터페이스와 Hive/Databricks/Redshift 커넥터를 제거합니다. CLIENT 모드는 독립형 경량 설치 옵션으로 유지됩니다.
-
2026년 2분기 - v6.1.0/6.1.1: 훈련 효율성과 생성 품질을 지속적으로 개선하기 위해 엔진이 2.6.1로 반복되고 QA 모듈이 1.10.6으로 업데이트됩니다.
기술 백서
arXiv 논문 "오픈 소스 합성 데이터 SDK를 사용하여 표 형식 데이터 액세스 민주화"(arXiv:2508.00718)는 2025년에 발표될 예정이며, SDK 아키텍처 TabularARGN 모델 설계 및 품질 평가 시스템을 체계적으로 설명합니다.
기술적인 장점
TabularARGN 아키텍처: 대부분 AI의 핵심 기술적 이점은 TabularARGN(arXiv:2501.12012) 심층 생성 모델에 있습니다. 이 아키텍처는 최고의 합성 데이터 품질을 유지하면서 유사한 모델보다 훈련 효율성이 1~2배 더 높습니다. 이를 통해 모델 크기를 압축하는 것이 아니라 훈련 알고리즘의 계산 효율성을 최적화하여 CPU 집약적인 환경에서도 몇 분 안에 수백만 개의 레코드를 훈련하고 생성할 수 있습니다.
유연한 다중 모델 지원: 표 형식 ARGN은 표 형식 데이터에 사용되고 DNN 일치는 그래프 관계에 사용되며 기본 LSTM(LSTMFromScratch-3m) 또는 미세 조정된 Hugging Face Hub의 모든 AutoModelForCausalLM 모델을 텍스트 데이터에 사용할 수 있습니다. 이 계층화 전략은 다양한 유형의 데이터가 가장 적절한 생성 방법을 사용하도록 보장합니다.
내장 품질 보증: 생성된 각 생성기에는 충실도 및 개인 정보 보호 지표에 대한 시각적 보고서를 제공하는 모델 통찰력 보고서가 자동으로 제공됩니다. 나중에 감지하는 대신 생성 시 과적합 및 누출을 방지합니다.
고급 샘플링 기능: 모든 양의 데이터에 대한 업샘플링, 모든 열을 기반으로 하는 조건부 시뮬레이션(예: "10,000개의 24세 남성 레코드 생성"), 과소 대표 그룹 가중치 밸런싱, 상황 인식 데이터 보간, 통계적 공정성 제어 및 온도 조절 규칙 제약 조건을 지원합니다. 이러한 기능을 통해 합성 데이터는 단순한 "복사본"이 아닌 목표 데이터 향상이 가능합니다.
차등 개인 정보 보호: 데이터 릴리스에 대한 수량화 가능한 개인 정보 보호 예산 보장을 제공하기 위해 교육 중에 차등 개인 정보 보호를 활성화할 수 있습니다.
사용방법
빠르게 시작하기 위한 오픈 소스 SDK
``파이썬
설치
pip install -U 'mostlyai[local]'
MostlyAI.sdk에서 가져오기 MostlyAI
SDK 초기화(로컬 모드)
대부분 = 대부분AI()
1. 사전 훈련된 생성기를 파일에서 가져오기
g = 대부분.generators.import_from_file( "https://github.com/mostly-ai/public-demo-data/raw/dev/census/census-generator.zip" )
2. 탐지는 1000개의 대표 샘플을 생성합니다.
df = 대부분.프로브(g, 크기=1000)
3. 고정된 열 값을 기반으로 생성
df = 대부분.probe(g, seed=[{"age": 24, "sex": "남성"}] * 10_000)
4. 나만의 발전기 훈련하기
팬더를 PD로 가져오기 원본_df = pd.read_csv( "https://github.com/mostly-ai/public-demo-data/raw/dev/titanic/titanic.csv" ) g = 대부분.train(name="타이타닉 데모", data=original_df)
5. 품질 보고서 보기
g.reports(display=True)
6. 합성 데이터 세트 생성
sd = 대부분.생성(g) df = sd.data()
### 엔터프라이즈 플랫폼
데이터 인텔리전스 플랫폼은 브라우저를 통해 액세스되며 다음을 제공합니다.
- **데이터 소스 연결**: Databricks, Snowflake, Postgres 등 데이터 플랫폼에 직접 연결
- **AI Assistant**: 자연어 쿼리 및 분석
- **프로젝트 협업**: 팀은 생성기, 데이터 세트 및 분석 보고서를 공유합니다.
- **보안 배포**: Kubernetes/OpenShift 비공개 배포 지원
### 세 가지 작동 모드
| 모드 | 설치방법 | 적용 가능한 시나리오 |
|---|---|---|
| 로컬(기본값) | `mostlyai[local]`(PyTorch 포함) | 로컬 개발, 개인 실험, 오프라인 컨텍스트 |
| 클라이언트 | `mostlyai`(경량) | 원격 SDK 엔드포인트에 연결 |
| 도커 | Dockerfile 빌드 | 격리된 컨텍스트 CI/CD 통합 |
## 제품 가격
대부분 AI는 오픈 소스 + 엔터프라이즈 플랫폼의 하이브리드 가격 모델을 채택합니다.
- **오픈 소스 SDK**: 완전 무료, Apache 2.0 라이선스. 기능 제한 없이 로컬에서 무제한 사용이 가능합니다.
- **엔터프라이즈 데이터 인텔리전스 플랫폼**: 프라이빗 배포 또는 SaaS 구독 기준으로 요금이 청구됩니다. 구체적인 가격은 공개되지 않았으며 견적은 Syntho Business([email protected])로 문의하시기 바랍니다. 가격 요소에는 데이터 볼륨, 사용자 수, 배포 노드 및 지원 수준이 포함됩니다.
- **클라이언트 모드**: 원격 엔드포인트에 연결할 때 플랫폼 리소스 소비가 포함되며 청구 방법은 공개되지 않습니다.
> 참고: 2026년 6월 Syntho 인수 이후 제품 로드맵 및 가격 전략이 조정될 수 있으니 공식 실시간 페이지를 참고하시기 바랍니다.
## 애플리케이션 시나리오
- **AI/ML 개발 및 훈련**: 기계 학습 모델을 위한 충실도 높은 훈련 데이터를 생성하여 실제 데이터 부족, 불균형 레이블 또는 제한된 개인 정보 보호 문제를 해결합니다. 과소대표된 모집단을 업샘플링하고 데이터 편향을 수정할 수 있습니다. **구현 팁**: 먼저 작은 샘플을 사용하여 Crawl/Walk/Run 점진적 학습을 수행한 다음 생성 품질을 확인한 후 확장합니다.
- **테스트 데이터 및 QA**: 개발/테스트/출시 전 상황에 맞게 현실적으로 구조화된 테스트 데이터를 생성하여 생산 데이터의 민감한 정보 유출 위험을 제거합니다. 통합 테스트, 스트레스 테스트 및 엔드 투 엔드 수용에 적합합니다. **구현 팁**: 모의 데이터는 엄격한 통계 요구 사항이 없는 시나리오에 적합하고, 합성 데이터는 실제 데이터 배포가 필요한 시나리오에 적합합니다.
- **데이터 공유 및 협업**: 개인 정보가 보호되는 합성 데이터 세트를 생성하고 PII를 노출하지 않고 팀과 조직 간에 데이터를 공유합니다. 클린룸 환경에서 안전한 데이터 협업을 지원합니다. **구현 팁**: 차등 개인 정보 보호 기능을 활성화하면 수량화 가능한 개인 정보 보호를 제공할 수 있으며 규정 준수 감사 시나리오에 적합합니다.
- **데모 및 프로토타입 디스플레이**: 판매 시연, 제품 프로토타입, 개념 증명을 위한 현실적이지만 민감하지 않은 데이터 세트를 생성하여 고객 커뮤니케이션 및 피드백 주기를 가속화합니다.
- **데이터 향상 및 편향 수정**: 원본 데이터를 기반으로 엣지 케이스나 과소 대표 그룹을 보완하여 모델의 일반화 능력과 공정성을 향상시킵니다.
## 해당자
- **데이터 과학자 및 ML 엔지니어**: SDK를 사용하여 노트북 환경을 벗어나지 않고도 Python 워크플로에서 직접 고품질 합성 데이터를 생성할 수 있습니다. 훈련 데이터를 자주 반복해야 하는 팀에 적합합니다.
- **데이터 엔지니어 및 DevOps**: Docker 또는 CLI 모드를 사용하여 합성 데이터 생성을 CI/CD 파이프라인에 내장하여 테스트 컨텍스트에 대한 보안 데이터를 자동으로 프로비저닝합니다. 데이터 생성 지연에 대한 요구 사항이 극단적인 실시간 시나리오에는 적합하지 않습니다.
- **비즈니스 분석가 및 규정 준수 팀**: 플랫폼의 AI Assistant를 통해 자연어로 데이터를 탐색하여 코드를 작성하지 않고도 분석 통찰력을 얻을 수 있습니다. 생성된 모델을 심층적으로 사용자 지정해야 하는 시나리오에는 적합하지 않습니다.
- **엔터프라이즈 데이터 플랫폼 팀**: 팀 간에 데이터를 공유해야 하지만 개인 정보 보호 규정 준수의 제약을 받는 조직은 대부분 AI를 사용하여 합성 데이터 샌드박스를 만들 수 있습니다. 전제조건: Kubernetes 운영 및 유지 관리 기능이 필요합니다.
- **사람에게는 적용되지 않음**:
- 이미지, 오디오, 비디오 등 비정형 합성 데이터가 필요한 시나리오 (주로 AI는 테이블과 텍스트에 중점을 둡니다)
- 생성된 데이터에 대한 극도의 실시간 요구 사항(초 미만 수준)이 있는 시나리오
- 통계적 신뢰성이 필요하지 않고 완전히 임의의 자리 표시자 데이터만 필요한 시나리오(규칙 모의 도구가 더 가볍습니다)
## 요약 및 전망
대부분 AI의 핵심 경쟁력은 TabularARGN 아키텍처의 효율성과 오픈 소스 전략에 있습니다. 이는 Apache 2.0 라이선스를 제공하는 몇 안 되는 합성 데이터 플랫폼 중 하나이며 경쟁 제품보다 훈련 효율성이 1~2배 더 높습니다. Swiss Post에서 JPMorgan까지의 기업 사례를 통해 금융, 통신, 의료 등 규제가 엄격한 산업에서 구현 능력이 검증되었습니다.
**현재 제한 사항 및 불확실성**:
- 2026년 6월 Syntho에 인수된 이후 제품 통합 방향, 브랜드 전략 및 가격 모델이 변경될 수 있습니다. 기업은 구매하기 전에 Syntho의 후속 제품 발표에 주의를 기울여야 합니다.
- 엔터프라이즈 플랫폼의 가격은 공개되지 않습니다. 계약 견적을 받으려면 해당 업체에 문의해야 합니다. 경쟁 제품의 가격을 직접 비교하는 것은 어렵습니다.
- 텍스트 데이터 생성은 Hugging Face 모델에 의존하며 오프라인/에어갭 환경에 배포하려면 추가 수동 모델 전송 단계가 필요합니다.
- 이미지/오디오/동영상 등 비정형 데이터는 지원되지 않습니다.
**구매/도입 위험 평가**: Mostly AI 플랫폼을 구매하기 전에 기업은 검증에 집중해야 합니다. ① Syntho 인수 후 기존 SDK의 오픈 소스 전략(비공개 소스 위험이 있는지 여부); ② Enterprise 버전의 실제 배포 비용 및 최소 리소스 요구 사항. ③ 중국어 등 다국어 데이터 생성의 품질; ④ 민영화 배포를 위한 규정 준수 인증(예: SOC2, GDPR 규정 준수) 먼저 오픈소스 SDK를 사용해 POC를 진행해 제작 품질을 확인한 뒤 비즈니스 요구 사항에 부합하는지 확인한 후 엔터프라이즈 버전에 대한 비즈니스 협상을 진행하는 것이 좋습니다.
버전 정보
- SDK 릴리스 6.1.1 :업데이트된 엔진 2.6.1 및 QA 1.10.6, 업그레이드된 Didabot 잠금 파일.
- SDK 릴리스 6.1.0 :엔진 2.6.0 및 QA 1.10.5를 업데이트했습니다.
- SDK 릴리스 6.0.0 :SDK 기본 우선 리팩터링, 플랫폼 전용 인터페이스 및 Hive/Databricks/Redshift 커넥터를 제거합니다.
- SDK 릴리스 5.10.0 :비즈니스 규칙 제약 조건(불균등 및 고정 조합), 업그레이드 엔진 2.4 및 PyTorch 2.9.1을 도입합니다.
- SDK 릴리스 5.9.0 :OAuth2 통합 지원이 추가되었습니다.
- 최초 오픈 소스 릴리스 :SDK의 첫 번째 오픈 소스 버전은 TabularARGN 아키텍처를 기반으로 하며 단일 테이블/다중 테이블 합성 데이터 생성을 지원합니다. 아직 공식적인 정확한 날짜는 없습니다.
사용자 후기