핵심 요점
- 텍스트 프롬프트로부터 사실적인 다국어 음성과 비언어적 소리(웃음, 한숨, 헐떡임, 음악)를 생성한다.
- 라이선스: MIT — 2023년 5월 1일부터 완전한 상업적 사용이 가능하다.
- Suno 자체 문서에 따르면 맞춤형 음성 클로닝은 지원하지 않는다.
- 공개 GitHub 저장소는 2024년 4월 5일 이후 커밋이 없다. 아카이브된 것으로 표시되지는 않지만 비활성 상태로 보인다.
- 아키텍처 설계상 출력은 한 번의 생성당 약 13~14초로 제한된다.
pip install bark는 절대 실행하지 마세요 — 관련 없는 패키지가 설치됩니다.pip install git+https://github.com/suno-ai/bark.git를 사용하세요.
📍 한 문장으로
Bark는 텍스트 프롬프트로부터 다국어 음성과 웃음, 한숨 같은 비언어적 소리를 생성하는 Suno의 오픈소스 MIT 라이선스 생성형 오디오 모델이지만, 맞춤형 음성 클로닝은 지원하지 않으며 공개 GitHub 저장소는 2024년 4월 5일 이후 커밋이 없다.
💬 쉽게 말하면
텍스트를 말하는 오디오로 바꾸고, 입력한 지시에 따라 웃거나 한숨 쉬는 것 같은 사람다운 소리, 심지어 간단한 음악까지 추가할 수 있는 AI 모델입니다 — 상업적으로 무료로 사용할 수 있지만 특정 인물의 목소리를 복제할 수는 없으며, Suno의 누군가가 여전히 적극적으로 개발하고 있는 것처럼 보이지는 않습니다.
📌참고: Bark를 만든 회사 Suno는 이제 AI 음악 생성 제품으로 더 널리 알려져 있습니다. PromptQuorum은 Suno가 여전히 Bark에 엔지니어링 자원을 할당하고 있는지 확인할 수 없었습니다. 공개된 커밋 기록이 유일하게 확인 가능한 증거이며, 2024년 4월 이후로는 아무것도 보여주지 않습니다.
Bark가 실제로 하는 일
Bark는 텍스트-오디오를 위한 트랜스포머 기반의 GPT 스타일 생성형 모델이며, 전통적인 텍스트 음성 변환 파이프라인이 아닙니다. 텍스트를 음소와 파형에 단순히 매핑하는 대신, 텍스트로부터 직접 오디오 토큰을 생성하며, 이것이 전통적인 TTS 엔진이 할 수 없는 비언어적 소리와 표현력 있는 운율을 만들어낼 수 있게 합니다.
- 몇 초 만에 완료되는 음성 생성. 공식 README에 따르면 Bark는 사전 훈련이나 미세 조정 없이 새로운 화자를 즉시 다룰 수 있는 구조로 설계되어 있다.
- 언어 간 클로닝을 지원하는 13개 언어. 공식 README에 따르면 Bark는 영어, 독일어, 스페인어, 프랑스어, 힌디어, 이탈리아어, 일본어, 한국어, 폴란드어, 포르투갈어, 러시아어, 터키어, 중국어 간체를 지원한다.
- 비언어적 소리 생성. Bark는 `[laughter]
,[laughs],[sighs],[gasps],[clears throat]를 인라인 텍스트 신호로 생성할 수 있으며, 간단한[music]`도 지원한다는 사실이 공식 README에 직접 문서화되어 있다 — 이는 PromptQuorum이 다루는 다른 어떤 로컬 TTS 엔진과도 차별화되는 기능이다. - 100개 이상의 화자 프리셋. Bark는 지원 언어 전반에 걸쳐 100개 이상의 내장 화자 프리셋을 제공하며, 참조 오디오 클립이 아니라
history_prompt인수(예:v2/en_speaker_6)를 통해 선택할 수 있다. - 맞춤형 음성 클로닝 없음. Suno 자체 문서는 Bark가 "현재 맞춤형 음성 클로닝을 지원하지 않는다"고 명확히 밝히고 있다 — 주어진 프리셋의 톤, 음높이, 감정, 운율을 맞출 수는 있지만, XTTS v2처럼 참조 녹음으로부터 임의의 인물 목소리를 복제할 수는 없다.
- 비결정적 출력. Bark 자체 README는 이를 "생성에서 창의적인 자유를 취하며, 이는 전통적인 텍스트 음성 변환 접근 방식보다 더 높은 분산의 모델 출력을 낳는다"고 설명한다 — 동일한 프롬프트를 두 번 실행해도 눈에 띄게 다른 결과가 나올 수 있다.
실제 사용 예시
이 명령어들은 Bark 자체가 문서화한 Python 빠른 시작 가이드를 따릅니다. 아래의 설치 경고에 주목하세요 — 이는 프로젝트의 README에서 직접 가져온 것입니다.
- 프롬프트는 약 13~14초의 음성 텍스트로 유지하세요. Bark 자체 README는 이것이 버그가 아니라 아키텍처 제한이라고 설명합니다: "Bark는 GPT 스타일 모델이며, 그 아키텍처/컨텍스트 윈도우는 대략 이 정도 길이의 생성물을 출력하도록 최적화되어 있다." 더 긴 내레이션은 여러 조각으로 나눈 다음 이어 붙여야 합니다.
- 실행마다 편차가 있을 것으로 예상하세요. 출력이 비결정적이므로, 특정한 방식으로 들리기를 원하는 대사는 몇 번 생성해 본 뒤 그중 가장 나은 것을 고르세요. 첫 번째 결과가 대표적일 것이라고 가정하지 마세요.
# Bark 설치 — Suno가 관리하지 않는 관련 없는 패키지가 설치되는
# "pip install bark"는 사용하지 마세요.
pip install git+https://github.com/suno-ai/bark.git
# Python API: 기본 생성
from bark import SAMPLE_RATE, generate_audio, preload_models
from scipy.io.wavfile import write as write_wav
preload_models()
text_prompt = "Hello, my name is Suno. And, uh — and I like pizza. [laughs]"
audio_array = generate_audio(text_prompt)
write_wav("bark_generation.wav", SAMPLE_RATE, audio_array)
# 무작위 목소리 대신 특정 화자 프리셋 사용
audio_array = generate_audio(
"This is a specific preset voice speaking a new sentence.",
history_prompt="v2/en_speaker_6",
)
# 작은 GPU에서 메모리 사용량 줄이기
import os
os.environ["SUNO_OFFLOAD_CPU"] = "True"
os.environ["SUNO_USE_SMALL_MODELS"] = "True"라이선스와 유지 관리 상태
Bark는 MIT 라이선스 하에 라이선스되어 있습니다. README에는 "Bark is now licensed under the MIT License, meaning it's now available for commercial use!"라고 명확히 명시되어 있으며, 날짜는 2023년 5월 1일입니다. XTTS v2(비상업용 CPML)나 F5-TTS(CC-BY-NC-4.0)와 달리, Bark의 모델 가중치나 출력물에는 상업적 제한이 없습니다. 이는 라이선스의 대략적인 형태를 설명한 사실적 요약일 뿐, 법률 자문이 아닙니다 — 상업적 배포 전에 직접 MIT 라이선스 전문을 읽으세요.
실제로 미결 상태인 문제는 라이선스가 아니라 유지 관리입니다. 이 리뷰의 발행 시점 기준으로, 공개된 suno-ai/bark 저장소의 커밋 기록은 2024년 4월 5일 이후 커밋이 없음을 보여줍니다. GitHub는 이 저장소를 아카이브된 것으로 표시하지 않으며, 커뮤니티는 계속해서 이슈를 열고 있지만, PromptQuorum은 그 기간 동안 관리자 활동, 릴리스, 또는 수정의 증거를 찾지 못했습니다. 회사인 Suno는 이제 Bark보다는 AI 음악 생성 제품으로 더 널리 알려져 있으며, PromptQuorum은 Suno가 현재 Bark 저장소에 어떤 엔지니어링 자원이라도 할당하고 있는지 확인할 수 없었습니다.
"적극적으로 유지 관리됨"을 미확인 상태로 취급하세요. 프로덕션 사용 사례에서 Bark에 의존한다면, 더 이상의 업데이트, 보안 패치, 버그 수정이 오지 않을 가능성을 염두에 두고, 지속적인 유지 관리가 사용 사례에 중요하다면 Coqui TTS(커뮤니티가 유지 관리하는 idiap/coqui-ai-TTS 포크 경유)나 Piper 같은 활발히 유지 관리되는 대안을 검토하세요.
Bark는 어떤 라이선스를 사용하나요?
자체 README에 따르면 Bark는 MIT 라이선스 하에 라이선스되어 있으며, 2023년 5월 1일부터 완전한 상업적 사용이 가능해졌습니다. 이는 법률 자문이 아닙니다. 상업적으로 사용하기 전에 직접 MIT 라이선스 전문을 읽으세요.
Bark가 적합하지 않은 경우
Bark는 독특한 연구 수준의 생성형 오디오 모델이지, 범용 프로덕션 TTS 엔진이 아닙니다. 다음과 같은 상황에는 적합하지 않은 도구입니다.
- 특정 인물의 목소리를 복제하는 것. Bark 자체 문서는 "현재 맞춤형 음성 클로닝을 지원하지 않는다"고 밝히고 있다. 짧은 참조 녹음으로부터 실제 목소리를 복제해야 한다면, XTTS v2가 정확히 그 목적을 위해 만들어졌다(비상업용 라이선스이긴 하지만) — Bark는 이를 대체할 수 없다.
- 보장된 지속적 지원이 필요한 프로덕션 시스템. 공개 저장소가 2024년 4월 5일 이후 커밋이 없고 Suno의 공개적 초점이 AI 음악 생성으로 옮겨간 상황에서, 프로덕션 의존성을 Bark의 지속적인 유지 관리, 보안 패치, 버그 수정에 거는 것은 PromptQuorum이 배제할 수 없는 실제 위험이다.
- 보급형 하드웨어에서의 저지연 실시간 애플리케이션. Bark 자체 README는 "엔터프라이즈 GPU와 PyTorch nightly에서" 달성하는 "거의 실시간"의 속도와 달리, "구형 GPU, 기본 Colab, 또는 CPU에서는 추론 시간이 상당히 느려질 수 있다"고 명시한다. Piper 같은 경량 엔진이 CPU 전용이나 임베디드 하드웨어에서의 실시간 사용에 더 적합하다.
- 일관되고 재현 가능한 출력. Bark 자체 README가 그 생성물을 전통적인 TTS보다 분산이 크고 비결정적이라고 설명하고 있으므로, 동일한 입력에 대해 매번 정확히 동일한 출력이 필요한 워크플로(IVR 시스템, 접근성 도구, 규제 대상 공시)에는 적합하지 않다.
- 한 번에 완성하는 장편 내레이션. Bark가 자체 README에서 GPT 스타일 아키텍처와 컨텍스트 윈도우 탓으로 돌리는 약 13~14초의 생성 시간 제한은, 오디오북 길이나 긴 팟캐스트 분량의 내레이션을 만들려면 텍스트를 수동으로 여러 조각으로 나눈 뒤 생성된 오디오 파일을 이어 붙여야 함을 의미한다.
Bark의 대안
XTTS v2
- 최적 용도:
- 6초의 참조 오디오로 실제 음성 클로닝, 17개 언어 지원
- 라이선스:
- CPML(비상업용)
Coqui TTS 툴킷
- 최적 용도:
- XTTS v2 및 다른 모델을 실행하는, 커뮤니티가 유지 관리하는 툴킷
- 라이선스:
- MPL-2.0
StyleTTS 2
- 최적 용도:
- 가장 자연스러운 영어 내레이션 품질(음성 클로닝 없음)
- 라이선스:
- MIT
Piper
- 최적 용도:
- 가장 빠른 CPU 전용 합성, 활발한 유지 관리, Raspberry Pi에서 실시간 실행
- 라이선스:
- GPL-3.0-or-later
ElevenLabs
- 최적 용도:
- 상업용 음성 클로닝과 적극적인 지원을 갖춘 관리형 클라우드 API
- 라이선스:
- 독점(유료 클라우드 API)
자주 묻는 질문
Bark란 무엇인가요?
Bark는 Suno가 공개한 오픈소스 생성형 텍스트-오디오 모델로, 참조 오디오 클립 없이 텍스트 프롬프트만으로 사실적인 다국어 음성과 웃음, 한숨, 간단한 음악 같은 비언어적 소리를 생성합니다.
Bark는 상업적으로 무료로 사용할 수 있나요?
네. Bark는 MIT 라이선스 하에 라이선스되어 있으며, Suno 자체 README에 따르면 2023년 5월 1일부터 완전한 상업적 사용이 가능해졌습니다. 이는 법률 자문이 아닙니다. 상업적 배포 전에 직접 MIT 라이선스 전문을 읽으세요.
Bark는 특정 인물의 목소리를 복제할 수 있나요?
아니요. Suno 자체 문서는 Bark가 "현재 맞춤형 음성 클로닝을 지원하지 않는다"고 명확히 밝히고 있습니다. 100개 이상의 내장 화자 프리셋 중 하나의 톤과 운율을 맞출 수는 있지만, 참조 녹음으로부터 임의의 목소리를 복제할 수는 없습니다. 이를 위해서는, 음성 클로닝을 위해 특별히 설계된(비상업용 라이선스 하의) XTTS v2에 대한 PromptQuorum의 리뷰를 참고하세요.
Bark는 여전히 유지 관리되고 있나요?
이는 불확실합니다. 공개 GitHub 저장소 suno-ai/bark는 2024년 4월 5일 이후 커밋이 없지만, 아카이브된 것으로 표시되지는 않았고 커뮤니티 이슈는 여전히 열리고 있습니다. 회사인 Suno는 이제 Bark보다는 AI 음악 생성 제품으로 더 널리 알려져 있습니다. PromptQuorum은 Suno가 현재 Bark 저장소에 엔지니어링 자원을 할당하고 있는지 확인할 수 없었습니다.
Bark의 단일 생성물은 얼마나 길 수 있나요?
한 번의 생성당 약 13~14초의 음성 텍스트입니다. Bark 자체 README는 이를 버그가 아니라 GPT 스타일 아키텍처와 컨텍스트 윈도우 탓으로 돌립니다 — 더 긴 콘텐츠는 여러 조각으로 나눈 다음 이어 붙여야 합니다.
왜 동일한 Bark 프롬프트가 때때로 다른 결과를 만들어내나요?
Bark 자체 README는 이를 "생성에서 창의적인 자유를 취하며, 이는 전통적인 텍스트 음성 변환 접근 방식보다 더 높은 분산의 모델 출력을 낳는다"고 설명합니다. 동일한 프롬프트를 두 번 실행하면 때때로 눈에 띄게 다른 오디오가 생성될 것으로 예상됩니다.
Bark는 얼마나 많은 GPU 메모리가 필요한가요?
공식 README에 따르면 전체 모델은 약 12GB의 VRAM이 필요합니다. 환경 변수 SUNO_USE_SMALL_MODELS=True를 설정하면 약 8GB에 들어가는 더 작은 모델이 로드되며, SUNO_OFFLOAD_CPU=True는 생성 사이에 모델을 CPU로 오프로드하여 메모리 사용량을 더 줄입니다.
결론
Bark는 PromptQuorum이 다루는 로컬 텍스트-오디오 모델 중 여전히 가장 독특한 모델로 남아 있습니다. 이 비교 대상들 중 완전히 관대한 MIT 라이선스 하에서 인라인 텍스트 신호로부터 웃음, 한숨, 간단한 음악을 생성하는 다른 모델은 없습니다. 라이선스가 명확해야 하는 개인 프로젝트, 프로토타입, 또는 상업용 제품에서 표현력 있고 비언어적 소리를 인식하는 오디오가 필요하다면, Bark는 라이선스 측면에서 진정으로 뛰어나고 위험이 낮은 선택입니다. 대부분의 독자에게 실제로 중요한 두 가지 결정 요소는 맞춤형 음성 클로닝이 없다는 점과 불확실한 유지 관리 상태입니다. 공개 GitHub 저장소는 2024년 4월 5일 이후 커밋이 없으며, Suno의 공개적 초점은 AI 음악 생성으로 옮겨갔습니다. 특정 인물의 목소리를 복제해야 한다면 대신 XTTS v2(비상업용 라이선스)를 사용하세요. 프로덕션을 위해 활발한 유지 관리와 빠르고 관대한 라이선스의 엔진이 필요하다면 Piper나 커뮤니티가 유지 관리하는 Coqui TTS 툴킷을 고려하세요. 관리형 상업용 대안으로는 ElevenLabs 비교를 참고하세요.
출처
- GitHub의 Bark — 공식 README: 언어, 화자 프리셋, 비언어적 소리 태그, 라이선스, 설치 지침.
- Bark 커밋 기록 — 유지 관리 활동의 공개 기록으로, 이 리뷰의 발행 시점 기준 2024년 4월 5일 이후 커밋을 보여주지 않는다.
- Hugging Face의 Bark — GitHub README의 기능 및 라이선스 설명을 반영한 모델 카드.
- XTTS v2 리뷰 — Bark가 제공하지 않는 음성 클로닝 대안에 대한 PromptQuorum의 전용 리뷰.
- 로컬 TTS 및 음성 클로닝 라이선스 — 로컬 TTS 엔진 전반의 완전한 라이선스 비교.
