OpenAI 속삭임
무료
OpenAI Whisper는 Encoder-Decoder Transformer 아키텍처를 기반으로 하며 680,000시간의 다국어 약 감독 데이터를 학습한 OpenAI의 오픈 소스 범용 음성 인식 모델입니다. 99개 이상의 언어로 음성 전사 및 번역을 지원하고 초소형(39M 매개변수)부터 대형(1.55B 매개변수)까지 총 7개 모델 사양을 제공하며 터보 최적화 버전, MIT 라이센스에 따른 오픈 소스입니다. OpenAI API의
OpenAI위스퍼
핵심 매개변수 및 통계
OpenAI Whisper는 39M 매개변수가 있는 소형부터 1.55B 매개변수가 있는 대형, 속도와 정확성을 위해 공동으로 최적화된 터보에 이르기까지 "모든 음성 작업을 포괄하는 단일 아키텍처"를 갖춘 모델 제품군으로 에지 장치에서 클라우드 서버에 이르기까지 모든 배포 시나리오를 포괄합니다.
| 모델 사양 | 매개변수 크기 | 영어 버전 | 비디오 메모리 요구 사항 | A100 상대 속도 | 다국어 지원 |
|---|---|---|---|---|---|
| 작은 | 39M | 작은.en | ~1GB | ~10배 | 예(영어 버전만 해당) |
| 베이스 | 74M | base.en | ~1GB | ~7배 | 예(영어 버전만 해당) |
| 작은 | 244M | small.en | ~2GB | ~4배 | 예(영어 버전만 해당) |
| 매체 | 769M | Medium.en | ~5GB | ~2배 | 예(영어 버전만 해당) |
| 대형(-v1/v2/v3) | 155B | 없음 | ~10GB | 1x(기준선) | 예(모든 언어) |
| 터보 | 809M | 없음 | ~6GB | ~8배 | 예(단, 번역 작업은 지원하지 않음) |
주요 디자인 특징: 위스퍼는 특정 언어나 특정 장면에 최적화된 전용 모델이 아닙니다. 대신 통합 인코더-디코더 변환기를 사용하여 음성 전사, 번역, 언어 인식 및 음성 활동 감지(VAD)의 네 가지 작업을 동시에 처리합니다. 이는 개발자가 파이프라인에서 여러 모델을 계단식으로 배열할 필요가 없으며 하나의 추론으로 오디오 입력에서 텍스트 출력까지의 전체 링크를 완료할 수 있음을 의미합니다. 가격은 다음과 같습니다. 단일 언어(예: 순수 영어 긴 음성 전사)의 높은 정확도 요구 사항의 경우 Whisper는 해당 언어(예: 특정 도메인의 DeepSpeech 또는 Kaldi와 같은 기존 ASR 시스템의 성능)에 대해 특별히 훈련된 사용자 정의 모델만큼 정확하지 않습니다.
터보 모델의 특수 포지셔닝: 809M 매개변수 터보는 Large-v3를 기반으로 아키텍처 수준에서 최적화되어 A100에서 대형 모델 추론 속도의 약 8배를 달성한 반면 WER(워드 오류율)은 약 0.5~1% 포인트만 증가합니다. 그러나 터보 모델은 번역 작업에 대해 훈련되지 않았다는 점에 유의해야 합니다. --task 번역을 호출하면 번역 결과 대신 원래 언어 텍스트가 직접 반환됩니다. 번역이 필요한 시나리오(영어가 아닌 음성 → 영어 텍스트)의 경우 다국어 전체 기능 버전(초소형/기본/소형/중형/대형)을 사용해야 합니다.
훈련 데이터 크기: Whisper는 680,000시간(약 77년)의 다중 언어, 다중 작업 약 감독 오디오 데이터에 대해 훈련되었습니다. 데이터는 99개 이상의 언어로 공개적으로 사용 가능한 인터넷 오디오에서 제공되며 자동화된 텍스트 정렬 및 정리 과정을 거칩니다. 훈련 규모는 당시 가장 큰 공개 연설 데이터 세트(예: 약 1000시간인 LibriSpeech)보다 2배 더 크며, 이것이 Whisper가 제로샷 일반화를 달성할 수 있는 핵심 이유입니다.
사용자 및 시장 인지도
Whisper의 커뮤니티 영향력은 오픈소스 음성 인식 분야에서 선도적인 위치에 있지만 이러한 리더십은 C-end 사용자의 직접적인 인식보다는 개발자 커뮤니티의 기술적 침투에 더 많이 반영됩니다.
GitHub 생태계: 웨어하우스는 84명의 기여자와 함께 105,000개가 넘는 별표와 12.8,000개의 포크를 받았습니다. GitHub에서 가장 높은 별점을 받은 음성 프로젝트 중 하나입니다. 이 데이터는 유사한 오픈 소스 음성 솔루션(예: Coqui STT 약 25,000개 별, Kaldi 약 14,000개 별)을 훨씬 능가하며 개발자 커뮤니티에서 Whisper의 침투 깊이를 반영합니다. PyPI 패키지 'openai-whisper'는 수천만 번 다운로드되었으며 최신 버전인 v20250625는 지속적으로 유지 관리 중입니다.
업계 채택: Whisper는 AI 애플리케이션 인프라의 "표준" 구성 요소가 되었습니다. 음성 메모 애플리케이션(예: Otter.ai의 대안인 Whisper Memos), 비디오 자막 생성 도구(예: MacWhisper, 자막 편집 통합), 고객 서비스 음성 분석 시스템, 회의 녹음 로봇 등, 많은 제품이 최하위 수준에서 Whisper 또는 그 파생 제품(예: fast-whisper의 CTranslate2 재구현)에 의존합니다. OpenAI 자체에는 ChatGPT 음성 모드에 Whisper가 내장되어 있고 음성 입력 엔진으로 Codex가 내장되어 있습니다.
학술적 영향: Whisper의 논문 "Robust Speech Recognition via Large-Scale Weak Supervision"(Radford et al., 2022)은 지난 3년 동안 음성 분야에서 가장 많이 인용되는 논문 중 하나가 되었습니다. 음성 인식에서 "약하게 감독되는 대규모 사전 훈련 + 제로 샘플 전송"의 타당성을 검증하고 동일한 기술 경로를 따라 일련의 후속 작업(예: SeamlessM4T, MMS 및 기타 Meta의 다국어 음성 모델)의 진화를 직접 촉진했습니다.
경쟁 제품과의 포지셔닝 차이: Whisper의 핵심 경쟁력은 단일 지표의 SOTA(특정 데이터 세트에서는 미세 조정된 맞춤형 모델이 여전히 Whisper를 능가할 수 있음)가 아니라, 제로 샘플 시나리오에서의 일반화 견고성, 즉 "어떤 미세 조정 없이 직접 전사하고 효과를 사용할 수 있다"는 기본 경험입니다. 대조적으로, Google USM 및 Meta MMS와 같은 경쟁 제품은 완전한 오픈 소스가 아니거나 모델 크기가 너무 커서 로컬에 배포할 수 없습니다. Whisper는 오픈 소스 접근성과 배포 유연성을 바탕으로 해자를 구축했습니다.
비용 이점
Whisper의 비용 구조는 오픈 소스 모델과 상용 API 사이에 명확한 선을 긋기 때문에 사용자는 필요에 따라 "무료 배포"와 "종량제 클라우드 API" 중에서 선택할 수 있습니다.
C 측/개인 사용자: 완전 무료(조건 적용): Whisper의 모델 가중치 및 코드는 MIT 라이선스에 따른 오픈 소스이며, 개인 사용자는 자신의 컴퓨터에서 완전히 무료로 사용할 수 있습니다. 로컬로 실행하는 데 드는 유일한 비용은 하드웨어입니다. 소형 모델은 CPU에서 실시간으로 기록될 수 있지만 대형 모델은 원활하게 실행하려면 최대 10GB의 비디오 메모리를 갖춘 GPU가 필요합니다. NVIDIA RTX 3060(12GB)이 장착된 소비자급 컴퓨터는 오프라인 전사를 위한 대형 모델을 실행할 수 있으며 하드웨어 비용은 약 2,000~3,000위안(일회 투자)입니다. 가끔 개인 사용자의 경우 이는 사실상 한계 비용이 0인 시나리오입니다.
개발자/API 호출: OpenAI Whisper API(whisper-1): OpenAI는 API를 통해 Whisper 서비스를 제공하며 가격은 약 $0.006/분(오디오 분당 약 0.6센트)이며, 전사 및 번역이라는 두 가지 모드를 지원합니다. 월별 1,000분 분량의 오디오를 처리하는 경우 API 요금은 약 US$6(약 RMB 42)입니다. 로컬 배포에 비해 API 모드는 GPU 하드웨어 투자와 운영 및 유지 관리 비용을 절약하고 처리량이 크게 변동하거나 지연 시간에 민감하지 않은 시나리오에 적합합니다.
| 비용 차원 | 온프레미스(자체 호스팅) | OpenAI 속삭임 API |
|---|---|---|
| 단가 | 일회성 하드웨어 투자 + 전기 비용 | $0.006/분 오디오 |
| 하드웨어 임계값(대형) | ~10GB 메모리 GPU | 로컬 GPU가 필요하지 않습니다 |
| 1000분/월 | 하드웨어 상각비 약 50-100위안/월 | 약 42위안/월 |
| 10,000분/월 | 하드웨어 상각비 약 50-100위안/월 | 약 420위안/월 |
| 개인정보 | 장치를 떠나지 않고 완전히 로컬 | 오디오를 OpenAI 서버에 업로드해야 함 |
| 대기 시간 | 로컬 GPU에 따라 다름 | 네트워크 + OpenAI 서버에 따라 다름 |
| 가용성 | 타사 서비스의 영향을 받지 않음 | OpenAI API 상태 활용 |
기업/개인 배포: 기업은 라이선스 수준(MIT 라이선스)에서 추가 비용 없이 자체 인프라에 Whisper를 배포할 수 있습니다. 그러나 프로덕션 수준 배포의 숨겨진 비용에 주의할 필요가 있습니다. 동시성이 높은 시나리오(예: 실시간 회의 기록 서비스를 지원하기 위한 4×A100)에는 다중 GPU 클러스터가 필요하며 운영 및 유지 관리 인력, 모델 버전 관리, 모니터링 및 경보 시스템의 구축 비용은 GPU 하드웨어 자체를 초과하는 경우가 많습니다. 기업은 자체 구축에 대한 투자 여부를 결정하기 전에 먼저 API를 사용하여 비즈니스 시나리오를 확인하고 모델을 로드하는 것이 좋습니다.
오픈 소스 파생 최적화의 암묵적 이점: 커뮤니티는 Whisper와 관련된 수많은 최적화 구현을 개발했습니다. 즉, 더 빠른 속삭임(CTranslate2 기반, 3~4배 더 빠른 추론), 속삭임.cpp(CPU 및 Apple Silicon의 실시간 전사), distil-whisper(증류된 버전, 95% 이상의 정확도를 유지하면서 모델 축소 50%)입니다. 이러한 파생 프로젝트는 Whisper의 배포 비용을 더욱 절감하며 리소스가 제한된 시나리오(모바일 단말기, 에지 장치)에 특히 유용합니다. 그러나 이러한 파생 상품의 라이선스 및 안정성은 개별적으로 평가해야 하며 OpenAI에서 공식적으로 유지 관리하지 않습니다.
주요 기능
Whisper의 핵심 기능은 "음성을 구조화된 텍스트로 변환"하는 메인 체인을 중심으로 돌아가지만, 실제 엔지니어링 가치는 완료하는 데 4~5개의 독립 모듈이 필요했던 음성 처리 파이프라인을 통합하는 모델을 사용하는 데 있습니다.
-
다국어 음성 전사(자동 음성 인식): 99개 이상의 언어로 된 음성을 실시간으로 텍스트로 변환합니다. 지원되는 언어에는 중국어, 영어, 일본어, 한국어, 주요 유럽 언어, 아랍어, 힌디어 및 기타 글로벌 주류 언어가 포함됩니다. 지원되는 언어의 전체 목록을 공식적으로 제공합니다(
whisper/tokenizer.py참조). 구현 팁: Whisper는 리소스가 풍부한 언어(영어, 중국어, 일본어)에 대해 가장 높은 인식 정확도(WER < 10%)를 가지며 리소스가 적은 언어(예: 일부 아프리카 및 남아시아 언어)에 대한 WER은 30%를 초과할 수 있습니다. 비즈니스 임계값 충족 여부를 확인하려면 포괄적인 데이터 세트의 평가 결과가 필요합니다. -
음성 번역: 영어가 아닌 음성을 영어 텍스트로 직접 번역합니다. 이는 "먼저 전사한 다음 번역"하는 2단계 솔루션과 다릅니다. Whisper의 디코더는 오디오 기능에서 영어 토큰을 직접 예측하여 ASR 오류가 번역 단계로 계단식으로 증폭되는 것을 방지합니다. 역량 경계: 터보 모델은 번역을 지원하지 않습니다. 대형 모델은 CoVoST-2 등 벤치마크에서 BLEU 점수가 30+이지만 순수 텍스트 번역 모델(예: GPT 시리즈)에 비해 번역 품질이 여전히 현저히 떨어지며 극도로 높은 번역 정확도가 필요한 시나리오에는 적합하지 않습니다.
-
언어 식별: 사용자가 미리 지정하지 않고도 오디오에 사용된 언어를 자동으로 감지합니다. 이는 여러 언어가 혼합된 오디오 시나리오(예: 국제 회의 녹음)에 특히 유용합니다. Whisper의 언어 인식 정확도는 모델 크기에 따라 다릅니다. 작은 모델은 매우 유사한 언어 쌍(예: 중국어 및 광둥어, 스페인어 및 포르투갈어)에서 쉽게 혼동되며 공식적인 시나리오에서는 중간 또는 대형 모델을 사용하는 것이 좋습니다.
-
음성 활동 감지(VAD): 오디오에서 음성 세그먼트와 비음성 세그먼트(침묵, 배경 소음)를 자동으로 구별하여 지능형 분할을 달성합니다. Whisper는 모델 추론의 부산물로 VAD를 출력하므로 추가 VAD 모듈이 필요하지 않습니다. 그러나 Whisper의 VAD 정확도는 전용 VAD 모델(예: Silero VAD)만큼 좋지 않으며 복잡한 소음 환경에서 부정확한 오디오 분할 경계로 인해 문제가 발생할 수 있습니다.
-
다중 파일 일괄 처리 및 형식 호환성: FLAC, MP3, WAV, M4A, OGG 등과 같은 주류 오디오 형식을 지원하고
whisper audio1.flac audio2.mp3 audio3.wav --model 터보명령줄을 통해 여러 파일을 한 번에 처리할 수 있습니다. 전사 결과는 TXT, VTT, SRT, TSV, JSON 등 다양한 형식으로 출력할 수 있으며, 자막 생성, 메모 정리, 데이터 분석 등 다운스트림 작업에 직접 연결할 수 있습니다.
모델 및 버전의 진화
Whisper의 버전 이력은 '기능 추가'가 아닌 '모델 품질 개선'을 기반으로 합니다. 각 주요 버전의 핵심 변경 사항은 더 나은 사전 학습 가중치 생성입니다.
최초 출시: 기술 로드맵 마련(2022-09~2023-01)
Whisper는 2022년 9월 논문과 모델 웨이트 형태로 처음 공개되었으며, 초기 버전은 v20230124 태그를 통해 2023년 1월 24일 GitHub에 공식 출시되었습니다. 이 버전에는 초소형/기본/소형/중형/대형의 5가지 사양, 총 9개 모델('.en' 영어 버전 포함)이 포함되어 있으며 훈련 데이터는 약하게 감독된 다국어 오디오 680,000시간입니다. 이 대형 모델 버전(나중에 Large-v1이라고 함)은 당시 감독된 SOTA에 가까운 LibriSpeech의 WER 6.1%(클린 세트)에 도달하여 인상적인 제로샷 일반화 기능을 보여주었습니다.
Large-v2 및 Large-v3: 정확도의 지속적인 반복(2023-03 ~ 2023-11)
- v20230314 (2023-03-15): Large-v2 모델 출시. 더 큰 훈련 단계와 더 나은 데이터 정리 전략을 통해 다국어 벤치마크의 평균 WER은 특히 일본어 및 한국어와 같은 알파벳이 아닌 언어에서 Large-v1에 비해 12-15% 감소했습니다.
- v20230918 (2023-09-19): Large-v2의 동반 버전으로 출시되었으며 토크나이저 및 추론 로직이 최적화되었습니다.
- v20231117 (2023-11-18): Large-v3 모델 출시. 이는 Common Voice 15 및 Fleurs와 같은 언어 간 벤치마크에서 Whisper 시리즈의 최고의 WER/CER 지표를 달성한 대규모 시리즈의 최종 버전입니다. Large-v3는 후속 터보 모델의 기반이기도 했습니다.
터보 모델: 속도 vs. 정확도 절충(2024-09~2024-10)
- v20240927 & v20240930 (2024-09 ~ 2024-10): 터보 모델을 소개합니다. Turbo는 독립적인 훈련을 위한 새로운 아키텍처가 아니라 Large-v3 가중치를 기반으로 하는 최적화된 추론 솔루션입니다. 아키텍처 프루닝, 주의 계산 최적화 및 엔지니어링 수준의 연산자 융합을 통해 A100에서 대형 모델 추론 속도의 약 8배를 달성할 수 있으며 비디오 메모리 요구 사항이 10GB에서 6GB로 줄어듭니다. 정확도 측면에서 영어 데이터 세트에 대한 터보의 WER은 Large-v3의 WER보다 약 0.5% 포인트 높을 뿐이지만 저자원 언어에서는 성능 저하가 더 뚜렷합니다. 터보의 주요 제한 사항(번역 작업을 지원하지 않음)은 릴리스 노트에 명확하게 명시되어 있습니다.
지속적인 유지관리 단계(2024~10~현재)
- v20250625(2025-06-26): Python 버전 호환성(Python 3.8-3.11) 및 종속성(tiktoken, PyTorch 등)을 위해 주로 업데이트된 최신 유지 관리 버전이며 새로운 모델 가중치가 도입되지 않습니다. Whisper 모델 수준이 상대적으로 안정적인 상태에 도달했음을 나타내는 OpenAI의 연구 개발 초점은 차세대 음성 모델(또는 GPT 시리즈의 음성 다중 모드 기능)로 이동했을 수 있습니다.
기술적인 장점
Whisper의 기술적 경로 선택은 처음부터 전통적인 ASR 프레임워크(예: Kaldi, Espnet)와 뚜렷한 대조를 이루었습니다. 특정 지표를 최적화하지 않고 "모든 시나리오에서 사용할 수 있는 모델"의 다양성을 추구합니다.
인코더-디코더 변환기 아키텍처: Whisper는 표준 변환기 시퀀스-시퀀스 구조를 채택합니다. 인코더는 80채널 log-Mel 스펙트럼 특징을 숨겨진 레이어 표현으로 인코딩합니다. 디코더는 자동 회귀 방식으로 토큰별로 출력 텍스트 토큰을 예측합니다. CTC, RNN-T와 같은 다른 일반적인 엔드 투 엔드 ASR 방식과 비교할 때 Transformer Seq2Seq의 장점은 디코더가 각 예측에서 전체 인코더 출력을 참조하기 위해 "뒤돌아볼" 수 있다는 것입니다. 이는 긴 오디오에서 의미 명확성(예: 음성 단어 판단)에 더 유리합니다. 단점은 CTC/RNN-T보다 추론 지연 시간이 더 높다는 것입니다. 왜냐하면 각 예측 단계는 이전 단계의 출력에 의존하고 완전히 병렬화될 수 없기 때문입니다.
다중 작업 훈련 형식: Whisper의 디코더는 특수 토큰을 사용하여 작업을 전환합니다. <|startoftranscript|>는 전사를 트리거하고 <|translate|>는 번역을 트리거하며 <|언어|>는 언어 인식을 트리거합니다. 모든 작업은 동일한 인코더 매개 변수 집합을 공유합니다. 즉, 단일 정방향 전달이 기록된 텍스트, 언어 레이블 및 음성 활동 정보를 동시에 출력할 수 있음을 의미합니다. 이 설계는 전통적인 음성 시스템의 "음향 모델 → 언어 모델 → 디코더"의 3단계 계열에서 오류 전파 문제를 방지합니다.
약하게 감독되는 680,000시간의 데이터를 사용한 교육 전략: Whisper의 교육은 수동으로 주석이 달린 데이터에 의존하지 않고 인터넷에서 복사된 대량의 오디오(예: YouTube 자막, 팟캐스트 텍스트)를 약한 감독 신호로 사용합니다. 데이터 분포는 자연스럽게 영어(~65%)와 고자원 언어 쪽으로 치우쳐 있지만 나머지 언어의 ~30%도 포함합니다. 많은 양의 데이터가 가져오는 주요 이점은 적대적 샘플 견고성입니다. 모델은 훈련 중에 다양한 악센트, 배경 소음 및 녹음 장치 차이를 확인했기 때문에 깨끗한 말뭉치(예: LibriSpeech)로만 훈련된 기존 시스템보다 실제 오디오에서 훨씬 더 나은 성능을 발휘합니다.
사전 처리 파이프라인: 오디오는 자동으로 16kHz로 리샘플링된 다음 80채널 Log-Mel 스펙트로그램으로 변환되고 추론 창을 위해 30초마다 처리됩니다. Whisper는 외부 VAD 모듈에 의존하지 않습니다. 내부적으로 <|notimestamps|>와 같은 특수 토큰을 예측하여 음성 활동 감지 및 오디오 분할을 완료합니다. 실제 사용 시 긴 오디오(30초 이상)는 슬라이딩 윈도우 스플라이싱(sliding window splicing)을 통해 처리되는데, Whisper의 transcribe() 메소드가 이 과정을 캡슐화합니다.
엔지니어링 구현 장점: Whisper는 출시 시 완전한 Python 패키지와 CLI 도구를 제공합니다. 사용자는 pip install openai-whisper만 사용하면 됩니다. 이 "pip 설치 준비" 제공 방법은 음성 모델 사용에 대한 임계값을 크게 줄입니다. 이전에는 사용 가능한 ASR 시스템을 구축하려면 일반적으로 몇 주가 소요되는 상황별 구성 및 모델 컴파일이 필요했습니다. 이는 Whisper가 커뮤니티에서 105,000개의 별을 받은 핵심 이유 중 하나이기도 합니다. 가장 정확하기 때문이 아니라 사용하기 가장 쉽기 때문입니다.
사용방법
Whisper는 각각 명령줄에서 Python 통합 개발 및 클라우드 API 호출을 빠르게 시험해 볼 수 있는 세 가지 액세스 방법 세트를 제공합니다.
| 사용 방법 | 사람들에게 적합 | 시작하는 방법 | 비용 | 특징 |
|---|---|---|---|---|
| 명령줄(CLI) | 모든 사용자 | 속삭임 audio.mp3 --모델 터보 |
무료(로컬 하드웨어 필요) | 제로 코드, 한 줄 명령 전사/번역 |
| 파이썬 SDK | 개발자 | 수입 속삭임; 속삭임.load_model("터보") |
무료(로컬 하드웨어 필요) | 심층 통합, 맞춤형 처리 로직 |
| 오픈AI API | 모든 사용자 | 컬 https://api.openai.com/v1/audio/transcriptions |
$0.006/분 | 로컬 GPU가 필요하지 않으며 대규모 동시성 지원 |
명령줄 빠른 시작: pip install -U openai-whisper를 설치하고 ffmpeg가 설치되어 있는지 확인하고 다음 명령을 실행하여 오디오 파일을 텍스트로 변환합니다(기본적으로 터보 모델이 사용됨):
``배쉬
영문 표기(기본값)
속삭임오디오.mp3
특정 언어의 전사
속삭임 japanese.wav --언어 일본어
영어가 아닌 음성을 영어로 번역
속삭임 중국어.mp3 --모델 대형 --언어 중국어 --작업 번역
여러 형식으로 출력
속삭임 회의.wav --model Medium --output_format srt
**Python SDK 통합**: Python에서 Whisper를 호출하는 데는 몇 줄의 코드만 필요합니다. 다음은 전체 전사 + 번역의 예입니다.
``파이썬
수입 속삭임
#모델 로드(첫 번째 실행에 대한 가중치 자동 다운로드)
model = Whisper.load_model("turbo") # 선택 사항: 소형/기본/소형/중형/대형/터보
# 오디오 녹음
결과 = model.transcribe("interview.mp3")
인쇄(결과["텍스트"])
# 영어가 아닌 오디오를 영어로 번역
결과 = model.transcribe("chinese_lecture.mp3", task="translate")
print(result["text"]) # 영어 번역 결과를 출력합니다.
# 세그먼트 정보 얻기(타임스탬프 포함)
결과["세그먼트"]의 세그먼트에 대해:
print(f"[{segment['start']:.2f}s -> {segment['end']:.2f}s] {segment['text']}")
OpenAI API 호출: API를 통해 Whisper를 사용하면 로컬 GPU가 필요하지 않으며 높은 동시성이 필요하거나 대규모 모델을 로컬에서 실행할 수 없는 시나리오에 적합합니다. 다음은 표준 호출 예시입니다(먼저 OpenAI API 키를 얻어야 함).
``배쉬
컬 https://api.openai.com/v1/audio/transcriptions \
-H "권한 부여: 전달자
파이썬 버전:
``파이썬
openai 가져오기 OpenAI에서
클라이언트 = OpenAI(api_key="<YOUR_API_KEY>")
#기록
open("audio.mp3", "rb")를 f로 사용:
성적표 = client.audio.transcriptions.create(
모델="속삭임-1",
파일=f,
언어="zh",
response_format="텍스트"
)
인쇄(대본)
# 번역하다
open("chinese_audio.mp3", "rb")을 f로 사용:
번역 = client.audio.translations.create(
모델="속삭임-1",
파일=f
)
인쇄(번역)
로컬 배포 참고 사항: whisper.load_model("large")을 처음 실행하면 약 3GB의 모델 가중치가 ~/.cache/whisper/에 자동으로 다운로드됩니다. 고속 네트워크 환경에서는 미리 다운로드를 완료하거나 whisper --download_root 매개변수를 통해 캐시 경로를 지정하는 것이 좋습니다. CPU 추론 시나리오의 경우 'whisper.cpp' 커뮤니티 구현(Apple Silicon에서 1x 실시간 속도를 달성할 수 있는 GGML/GGUF 양자화 기반)을 사용하는 것이 좋습니다.
제품 가격
Whisper의 제품 가격 책정 전략은 "오픈 소스 무료 + 클라우드 API 종량제"의 2단계 구조이며 C 측 구독 모델이 없습니다.
오픈 소스 버전(자체 호스팅): MIT 라이센스, 모델 가중치 및 코드가 완전히 무료입니다. 개인용 및 상업용 모두 라이센스 비용이 없습니다. 자체 호스팅의 전체 비용은 하드웨어 인프라입니다. 예를 들어 터보 모델을 실행하려면 약 6GB의 VRAM(예: RTX 3060 12GB 또는 Apple Silicon M1/M2의 경우 8GB 통합 메모리)을 갖춘 GPU가 필요합니다. CPU 추론이 가능하지만 속도가 느립니다(고급 CPU에서 터보 모델의 실시간 속도 ~0.3배).
OpenAI API(whisper-1): 가격은 $0.006/분(오디오 분당 약 0.6센트)이며 전사 및 번역 인터페이스를 모두 지원합니다. 청구는 오디오의 원래 지속 시간을 기준으로 계산되며 모델이 출력하는 토큰의 양과는 아무런 관련이 없습니다. 무료 할당량 측면에서 신규 OpenAI API 사용자는 일반적으로 $5-18의 평가판 할당량을 갖지만 이 할당량은 일반적인 API 할당량(Whisper에만 국한되지 않음)이며 모든 OpenAI API 서비스 간에 공유될 수 있습니다.
엔터프라이즈/높은 사용량 시나리오: 월간 처리량이 100,000분을 초과하는 기업 사용자의 경우 OpenAI 비즈니스 팀을 통해 맞춤형 가격 책정 및 SLA 보장을 신청할 수 있습니다. 대규모 시나리오에서 자체 호스팅 솔루션의 경제성은 하나씩 계산해야 합니다. 예를 들어 월별 처리 시간 50,000분, API 요금은 월 약 $300(약 2,100위안), 자체 구축한 4×A100 클러스터의 월별 상환 비용은 약 20,000~30,000위안입니다. 자체 호스팅은 처리량이 계속 증가하고 대기 시간 및 데이터 개인 정보 보호에 대한 엄격한 요구 사항이 부과되는 경우에만 상당한 비용 이점을 갖습니다.
가격에 대한 공개 정보 없음 구체적인 세부 정보는 다음과 같습니다. OpenAI는 Whisper API에 분당 요청 수(RPM)에 대한 하드 주파수 제어 제한이 있는지 여부를 공개하지 않았으며 기업 맞춤형 가격에 대한 기본 할인율도 공개하지 않았습니다. 실시간 정보는 공식 가격 페이지 및 API 문서를 참조하세요.
애플리케이션 시나리오
Whisper의 애플리케이션 시나리오는 개인 효율성, 콘텐츠 제작 및 엔터프라이즈 서비스를 포괄합니다. 다음 네 가지 시나리오는 대규모로 검증되었으며 명확하게 정량화 가능한 이점을 가지고 있습니다.
-
회의 및 인터뷰 콘텐츠 자동화: 회의 녹음, 인터뷰 오디오, 팟캐스트 콘텐츠를 자동으로 녹취록 및 검색 색인으로 변환합니다. 대형 또는 터보 모델을 사용하면 1시간 분량의 오디오 전사를 5~15분 안에 완료할 수 있으며(GPU에 따라 다름) 출력 SRT/VTT 형식을 편집 소프트웨어로 직접 가져올 수 있습니다. 정량적 이점: 전통적으로 오디오를 수동으로 텍스트로 변환하는 데는 시간당 약 4~6시간이 소요됩니다. Whisper를 사용하면 기계 처리 시간 5~15분 + 수동 검토 시간 30분으로 단축되어 효율성이 5~10배 향상됩니다. 플로어 팁: 다중 사용자 회의 시나리오에서는 "동일 녹음 누화"로 인한 화자의 혼란을 피하기 위해 독립적인 마이크 녹음 또는 별도의 채널 녹음을 사용하는 것이 좋습니다. Whisper 자체는 화자 분리(분할)를 지원하지 않으며 화자 인식 모듈(예: PyAnnote Audio)의 추가 통합이 필요합니다.
-
비디오 자막 및 현지화: 비디오 콘텐츠에 대한 다국어 자막을 자동으로 생성합니다. 먼저 Whisper를 사용하여 원래 언어로 타임스탬프 전사를 생성한 다음 번역 API를 사용하여 대상 언어로 자막을 생성합니다. 과정은 영상 오디오 추출 → 귓속말 전사(타임스탬프 포함) → 번역 → 자막 파일 내보내기입니다. 터보 모델은 속도가 빠르기 때문에 이 시나리오에서 가장 인기가 높습니다. 10분짜리 비디오를 30초 안에 복사할 수 있습니다. 기능 경계: Whisper의 타임스탬프 정확도는 무음 세그먼트에서 더 정확하지만, 음성 속도가 자주 변경되거나 배경 음악 간섭이 있는 세그먼트에서는 1~3초 정도 벗어날 수 있으므로 나중에 타임라인을 미세 조정해야 합니다.
-
고객 서비스 품질 검사 및 음성 분석: 서비스 품질 모니터링, 음성 준수 검토 및 고객 감정 분석을 위해 고객 서비스 통화 녹음을 텍스트로 기록합니다. 이 시나리오에서는 데이터 규정 준수 요구 사항(금융, 보험 산업 등)을 충족하기 위해 민영화된 배포가 필요한 경우가 많습니다. Whisper의 대형 모델(large-v3)은 전화 오디오(8kHz 샘플링, 협대역, 잡음)에서 소형/기본 버전보다 더 나은 성능을 발휘하며 소형보다 WER 5-10% 포인트 낮습니다. 구현 팁: 이 분야의 용어 및 억양 측면에서 모델의 성능이 수용 표준을 충족하는지 확인하기 위해 프로덕션으로 가져오기 전에 500-1000개의 실제 통화 녹음으로 WER 벤치마크 테스트를 수행하는 것이 좋습니다.
-
음성 상호 작용 및 접근성: 청각 장애가 있는 사람들을 위해 실시간 음성 전사 자막을 제공하거나 음성 도우미를 위한 음성-텍스트 입력 파이프라인을 제공합니다. ChatGPT의 음성 모드에서 Whisper는 음성 → 텍스트의 첫 번째 역할을 맡습니다. 개별 개발자는 Whisper를 스마트 스피커, 자동차 시스템 및 보조 장치에 통합하여 로컬 음성 입력을 달성할 수도 있습니다. 구현 팁: 실시간 시나리오에서는 대기 시간을 줄이기 위해 더 빠른 속삭임 또는 Whisper.cpp 구현을 사용하는 것이 좋습니다. 순수 Python 버전은 CPU의 실시간 추론 기능이 제한되어 있습니다.
해당자
Whisper의 적용 범위는 프로그래밍 경험이 전혀 없는 최종 사용자부터 심층적인 맞춤화가 가능한 AI 엔지니어까지 다양합니다. 그러나 다양한 역할에 따라 적응 비용과 가치는 크게 다릅니다.
-
콘텐츠 제작자 및 비디오 제작자: 프로그래밍이 필요 없이 CLI 도구를 통해 한 번의 클릭으로 자막 파일(SRT/VTT)을 생성합니다. macOS 플랫폼의 MacWhisper 및 Whisper Transcription과 같은 GUI 애플리케이션은 사용 장벽을 더욱 낮춥니다. 경계에 적합하지 않음: 자막 타임스탬프의 정확성에 대해 매우 엄격한 요구 사항이 있는 전문 영화 및 TV 후반 작업 작업자의 경우 Whisper의 타임스탬프는 여전히 수동으로 미세 조정되어야 합니다. 높은 번역 품질이 필요한 현지화 프로젝트의 경우 번역 프로세스에 들어가기 전에 Whisper에서 생성된 전사 결과를 수동으로 확인하는 것이 좋습니다.
-
개발자 및 독립 개발자: Python SDK 또는 OpenAI API 통합을 통해 몇 시간 만에 앱에 음성-텍스트 변환 기능을 추가할 수 있습니다. 권장되는 경로는 먼저 API를 사용하여 제품 개념을 확인한 후(GPU 투자 없음), 확장 후 로컬 배포의 비용 효율성을 평가하는 것입니다. 전제 조건: 기본적인 Python 컨텍스트 및 pip 패키지 관리 기능이 필요합니다. ffmpeg의 오디오 처리 기본 사항을 이해해야 합니다. 로컬 배포 솔루션에는 GPU 또는 충분한 메모리(중형 이상 모델을 실행하려면 최소 8GB)가 필요합니다.
-
기업, 중견 및 대규모 조직: 고객 서비스 음성 분석, 회의 기록, 미디어 자료 디지털화 등의 시나리오에서 민영화된 배포. 권장되는 초기 파일럿 경로는 1~2개의 비즈니스 시나리오 선택 → API 또는 단일 머신 배포를 사용하여 PoC 완료 → 정확성과 비용이 요구 사항을 충족하는지 확인 → 다중 노드 클러스터로 확장입니다. 구매 전제 조건: 기업은 "AI를 먼저 사용한 후 확인"하기보다는 명확한 음성 데이터 자산(통화 녹음, 회의 아카이브, 비디오 데이터베이스)과 정량화 가능한 효율성 목표(예: "수동 녹음 시간 80% 단축")를 이미 갖추고 있어야 합니다. 배포하기 전에 프로덕션 환경에서 Whisper의 지속적인 운영 및 유지 관리 비용(모델 버전 관리, GPU 클러스터 모니터링, 장애 복구 등)을 평가해야 합니다.
-
연구원 및 NLP 엔지니어: 다국어 음성 기본 모델인 Whisper는 음성 번역, 언어 인식 및 악센트 견고성과 같은 분야의 학술 연구에 널리 사용됩니다. 오픈 소스 가중치는 세밀한 미세 조정(예: 의학 및 법률과 같은 전문 분야의 어휘에 대한 도메인 적응)을 위한 출발점으로도 사용할 수 있습니다. 경계에 적합하지 않음: Whisper의 아키텍처는 처음부터 미세 조정에 최적화되어 있지 않습니다. 모든 작업을 디코더 토큰 시퀀스로 인코딩하고 미세 조정에는 특수 토큰을 사용자 정의해야 합니다. 심층적인 도메인 사용자 정의(예: 특정 소음 환경에서 산업 장비 지침 식별)가 필요한 시나리오의 경우 Espnet 또는 Kaldi와 같은 보다 사용자 정의 가능한 프레임워크를 고려하는 것이 좋습니다.
요약 및 전망
Whisper의 핵심 가치는 "통합 모델을 사용하여 휴대용 장치의 가벼운 전사부터 서버 수준의 고정밀 번역까지 제로 샘플 방식으로 전체 범위의 음성 작업을 포괄하는 것"입니다. 모든 지표에서 SOTA는 아니지만, 진정한 "음성-문자 변환"을 언제든지 호출할 수 있는 인프라로 만드는 최초의 오픈 소스 솔루션입니다.
현재 핵심 장점: 7개 모델 사양은 에지에서 클라우드까지 모든 배포 시나리오를 포괄하고, MIT 라이선스는 상업적 사용에 대한 법적 위험을 제거하며, 105,000개 이상의 GitHub 스타가 커뮤니티 생태계의 성숙도를 확인합니다. 더 빠른 속삭임, 속삭임.cpp, distil-whisper 및 기타 프로젝트와 같은 파생 프로젝트는 성능 경계를 더욱 확장합니다. OpenAI API의 핵심 구성 요소 중 하나인 Whisper는 생산 관련 피드백과 엔지니어링 유지 관리를 계속해서 받고 있습니다.
현재 주요 제한사항: Whisper는 엔드투엔드 스피커 분리(분할)를 지원하지 않으며 전문 모듈의 추가 통합이 필요합니다. 터보 모델의 변환 기능이 부족하다는 것은 일부 장면에서 여전히 더 큰 모델을 사용해야 한다는 것을 의미합니다. 자체 호스팅 시나리오의 GPU 리소스 오버헤드는 개별 사용자에게 임계값을 제시합니다(대형 모델에는 10GB의 비디오 메모리가 필요함). 타임스탬프 정확도는 복잡한 오디오에서 여전히 편향되어 있습니다. API 모드의 오디오 업로드는 개인 정보 보호에 민감한 시나리오에서 규정 준수 위험을 초래합니다. 초저자원 언어에 대한 Whisper의 인식률은 여전히 제한적입니다.
후속 관찰 포인트: OpenAI가 Whisper의 기능을 차세대 GPT 다중 모달 모델(예: GPT 엔드 투 엔드에서 직접 처리되는 음성 입력)에 통합할지 여부로 인해 Whisper를 독립형 모델로 유지 관리하는 속도가 느려질 수 있습니다. 속삭임.cpp의 엣지 장치 범위에 대한 Fast-Whisper의 지속적인 최적화와 같은 커뮤니티 스핀오프 프로젝트가 공식 업데이트 속도가 느려진 후 공백을 채울 수 있습니까? 또한, 차세대 음성 모델(Meta의 SeamlessM4T v2 등)의 다국어 번역 품질 발전이 벤치마크에서 Whisper를 능가할 것인지도 계속해서 주목해볼 만하다.
획득 및 채택 위험 평가: 개별 개발자 및 콘텐츠 제작자의 경우 채택 위험이 거의 없습니다. 시행착오 비용 없이(오픈 소스 및 로컬 실행) 가치를 입증할 수 있습니다. 기업의 경우 비핵심 시나리오(예: 내부 회의 녹화, 비디오 자막 생성)를 시험하고, 실제 비즈니스 데이터로 WER 벤치마크 테스트를 완료하고, 모델 정확도가 예상만큼 정확하지 않은 코너 케이스를 처리하기 위한 수동 검토 프로세스를 구축하는 것이 좋습니다. 사용자 음성 데이터 처리와 관련된 경우 자체 호스팅 솔루션의 데이터 격리 조치가 업계 규정 준수 요구 사항(예: GDPR, 개인정보 보호법)을 충족하는지 확인하세요. OpenAI API 모드를 선택하는 경우 API 버전 업데이트가 이전 버전과 호환되는지 여부와 서비스 중단 시 다운그레이드 계획(예: 기본 서비스를 제공하기 위해 로컬 초소형 모델로 폴백)에 주의해야 합니다. 장기적인 음성 AI 전략을 가진 회사의 경우 Whisper를 채택하는 동안 아키텍처 종속을 피하기 위해 더 큰 사용자 정의 잠재력을 갖춘 차세대 음성 프레임워크의 진화에도 주의를 기울이는 것이 좋습니다.
관련 도구: 일레븐랩스, udio
버전 정보
- 속삭임 v20250625 :커밋 31243ba를 기반으로 하는 코드 호환성 업데이트 및 종속성 수정을 포함한 최신 유지 관리 릴리스입니다.
- 속삭임 v20240930 :정확도 손실을 최소화하면서 약 8배 더 빠른 Large-v3의 최적화 버전인 터보 모델(809M 매개변수)을 소개합니다.
- 속삭임 v20231117 :대형 v3 모델 출시 및 여러 가지 안정성 개선을 포함하여 공식적인 정확한 날짜는 아직 없습니다.
- 속삭임 v20230918 :Large-v2 모델의 도입으로 다국어 인식 정확도가 대폭 향상되었습니다.
- 속삭임 v20230314 :초기 유지 관리 버전으로 여러 종속성 호환성 문제를 해결했습니다.
- 속삭임 v20230124 :초기 공개 버전은 약하게 지도된 680,000시간의 데이터 교육을 기반으로 소규모 모델부터 대규모 모델까지 6가지 모델 사양을 출시합니다.
사용자 후기