로컬 받아쓰기와 클라우드 받아쓰기의 차이
영상에 자막을 붙일 때 음성 인식은 내 컴퓨터에서 할 수도 있고 파일을 서버로 보내서 할 수도 있습니다. 둘 다 쓰입니다. 차이는 개인정보, 비용, 속도, 네트워크 의존도에 있습니다.
한 문장으로 구분하면
로컬 받아쓰기: 모델이 내 Mac에 설치되어 있고 오디오가 이 컴퓨터를 떠나지 않습니다. 클라우드 받아쓰기: 오디오나 영상을 서비스 업체의 서버로 보내 인식하고 텍스트만 돌려받습니다.
네 가지 관점에서 비교
| 로컬 | 클라우드 | |
|---|---|---|
| 개인정보 | 파일이 Mac 안에 머뭅니다. 공개 전 인터뷰, 사내 교육, 고객 영상에 적합합니다 | 파일을 업로드해야 합니다. 보관 여부와 사용 방식은 서비스 업체의 정책에 달려 있어 직접 읽어 봐야 합니다 |
| 비용 | 모델은 무료로 내려받을 수 있습니다. 도구 자체의 가격은 제각각이라 한 번 구매하는 것도, 무료 오픈 소스도 있습니다. 내 컴퓨터의 연산 능력을 씁니다 | 분 단위 과금이나 구독이 흔하며 많이 쓸수록 비용이 늡니다 |
| 속도 | 기종에 따라 다릅니다. Apple 실리콘 Mac은 Metal로 가속하며 오래되었거나 메모리가 작은 기기는 느립니다 | 업로드 속도와 서버 대기열에 달려 있고 긴 영상은 업로드만으로도 시간이 걸립니다 |
| 인터넷 연결 | 처음 모델을 내려받을 때만 필요하고 이후에는 오프라인으로 작동합니다 | 매번 연결이 필요합니다 |
로컬 방식의 대가
- 디스크와 메모리를 씁니다: 음성 모델은 수백 MB에서 수 GB 크기의 파일입니다.
- 내 기기가 계산을 마칠 때까지 기다려야 합니다: 처리하는 동안 컴퓨터가 평소보다 뜨거워지고 팬이 돌아갑니다.
- 기능이 내 기기에 좌우됩니다: 클라우드 서비스는 화자 구분, 용어집, 팀 협업을 제공하는 경우가 있지만 로컬 도구에는 없을 수 있습니다.
Twinsub의 구체적인 방식
- 인식: Whisper large-v3-turbo를 whisper.cpp로 Mac에서 실행합니다(whisper.cpp와 Whisper 모델은 모두 MIT 라이선스입니다).
- 번역: macOS에 내장된 온디바이스 번역입니다. 어떤 언어를 처음 번역할 때 시스템이 언어 팩 다운로드를 요청할 수 있으며 그 뒤에는 오프라인으로 작동합니다.
- 네트워크를 쓰는 곳은 두 군데뿐입니다. 음성 모델을 처음 한 번 내려받을 때와 macOS가 언어 팩을 내려받을 때입니다. 영상과 자막은 업로드되지 않습니다.
- 앱은 익명 사용 이벤트(성공 또는 실패, 소요 시간, 시스템 버전)를 보내며 파일 이름과 자막 내용은 포함하지 않습니다. 설정에서 끌 수 있습니다. 자세한 내용은 개인정보 처리방침을 참고하세요.
어떻게 고를까
- 밖으로 내보낼 수 없는 내용이거나 영상이 길고 자막 수가 많다면 로컬을 우선하세요.
- 컴퓨터 사양이 낮고 짧은 영상을 가끔 한두 개 처리할 뿐이라면 클라우드가 더 편합니다. 다만 먼저 서비스의 개인정보 약관을 확인하세요.
- 이미 편집 프로그램의 유료 플랜을 쓰고 있다면 그 내장 기능을 그대로 쓰면 되고 바꿀 필요가 없습니다.
업데이트: 2026-10-11 Twinsub 홈으로 돌아가기