그 동안 영상 자막 추출기와 번역하는 파이썬 스크립트를 직접 만들기도 했고, 다른 방법을 소개해기도 했었습니다.
기존의 방법들(Faster-Whisper-XXL, stable-ts, Whisper)이 잘 작동하는 듯 하면서도, 어둠의 경로에서 받은 일본의 영상에서는 약간 맥을 못추는 경향이 있었습니다.
- 일반적인 대화가 아닌 경우 자막 추출 시에 유령 음성이 끼거나 자막을 놓치거나 싱크가 맞지 않는 등 다양한 문제
- 번역의 경우에도 DeepL API나 translategemma도 어느 정도 괜찮은 편이지만, 그냥 호출할 경우 맥락이 약간 없이 번역되는 DeepL이 있고, translategemma는 모아서 보내면 맥락은 생기지만 야한 용어는 번역이 제한되거나 부자연스러운 점
이번에 Codex가 알려 준 일본에서 만든 Kotoba-Whisper v2.2와 중국에서 만든 Hy-MT2 번역 모델(2026년6월)은 꽤 쓸만한 느낌을 주기에 소개해 보려고 합니다.
아래와 같이 일본어 영상에서 자막을 추출하고, 한국어 자막으로 번역해 주는 파이썬 스크립트를 Codex 5.5 medium이 만들어 주었습니다.
일단은 VRAM이 8GB이상인 엔비디아의 그래픽카드(예: RTX시리즈)와 최신 드라이버가 설치된 윈도우11에서 작동이 됩니다. 이론적으로는 리눅스에서도 작동이 되지만 테스트는 하지 않았습니다.
- 실리콘칩 M1 이상을 탑재한 맥에서도 사용이 가능합니다. M1에서는 많이 느리기는 합니다만...
아래 테스트는 RTX3090(24GB VRAM)에서 테스트한 모습입니다. 번역에서는 30B모델의 Q4 양자화된 모델을 썼습니다.

사용된 기술
- 일본어 인식 성능이 뛰어난 Kotoba-Whisper v2.2 음성 인식 모델
- Whisper에 기반했으나 일본어로 된 7,203,957개의 오디오 클립(평균 5초 길이의 오디오에 18개의 텍스트 토큰 포함)으로 구성하고 최적화했으며, Whisper large v3 모델보다 6배 가량 빠르다고 합니다. 또한, 화자 분리 모델과도 결합할 수 있습니다.
- https://huggingface.co/kotoba-tech/kotoba-whisper-v2.2 및 https://huggingface.co/kotoba-tech/kotoba-whisper-v2.0 https://hf.co/pyannote/segmentation-3.0
- 자연스러운 번역을 제공하는 텐센트의 Hy-MT2 번역 모델
- Hy-MT2-30B-A3B은 특히 성능이 좋았는데, 300억 파라미터 중 30억 개(Active 3B)만 활성화되는 MoE(전문가 혼합) 아키텍처를 채택해, 대형 모델 수준의 품질과 경량 모델 수준의 속도를 동시에 제공한다고 합니다.
- https://github.com/Tencent-Hunyuan/Hy-MT2
사용 소감
- 같이 적용된 pyannote의 segmentation-3.0은 음성 구간을 꽤 잘 분할해 주었습니다. 이로 인해, 일본어에 강한 Kotoba-Whisper의 성능을 최대한 활용할 수 있었습니다. 물론, 그 와중에도 영상에 따라 오인식되거나 유령 자막이 없어지지는 않습니다. 그래도 일반 Faster-Whisper-XXL이나 Whisper large모델들, stable-ts보다는 일본어를 잘 인식할 것으로 보입니다.
- translategemma는 번역은 잘 하는 편이지만, 특정 단어는 번역을 거부하게 되어 있었습니다. 반면에 Hy-MT2는 제약이 없고 번역을 생각보다 잘 합니다.
설치 방법
- https://github.com/sevengivings/Kotoba-Whisper-CLI 에서 Download ZIP을 하거나, 윈도우11에 git 을 설치한 후 git clone 명령을 통해 받은 후 위 링크의 설명을 보고 따라 하시면 됩니다.
참고 사항
- 번역은 로컬 컴퓨터에 별도로 설치한 Ollama의 모델을 이용하게 되는데, 명령어(파워쉘, 터미널 등에서)를 사용하여 "ollama pull 모델명" 방식으로 자신의 컴퓨터의 사양에 맞는 모델을 미리 받아두면 됩니다. 챗지피티나 제미나이에게 컴퓨터 메모리, 그래픽카드 종류를 알려주면 적절한 transslategemma나 Hy-MT2 모델을 추천해 줍니다.
- Kotoba는 일본어에만 적용됩니다. Qwen3-ASR은 한국어도 가능합니다. (출력파일명에 .ja.가 붙기는 합니다).
uv run --no-sync kotoba process --language korean --output-dir ./tmp-output --asr-backend qwe3-mlx 입력파일.wav
관련 과거 글들
이전에 작성했던 관련 글은 다음과 같습니다.
비디오 자막 추출 Faster-Whisper-XXL 사용 방법
비록 UI(사용자 인터페이스)가 없지만 비디오로부터 자막을 추출하는 하나의 방법인 Faster-Whisper-XXL의 사용법을 기록해보겠습니다. Whisper계열 자막 추출 방법 중에는 속도가 가장 빠릅니다. 만약,
imky.tistory.com
stable-ts (Whisper)로 영상 자막을 파이썬 코드로 추출해 보기 및 DeepL 파일 번역 도우미
[최신 업데이트 소스 위치] 내용을 계속 수정 보완 중이라서, 최신 내용은 아래 링크를 참고해 주세요. 영상 자막 추출 후 DeepL 앱/웹으로 워드파일을 이용하여 수동 번역을 원할 경우: https:/
imky.tistory.com
'AI' 카테고리의 다른 글
| Roo Code와 QwQ에게 간단한 파이썬 코딩 시켜보기 (0) | 2025.03.13 |
|---|---|
| DeepL번역으로 Youtube 유튜브 외국어 영상 자막 보기 (0) | 2023.09.16 |
| 자막 생성 Whisper 미디엄 모델을 2GB VRAM NVIDIA 노트북에서 이용하기 (3) | 2023.08.27 |
| DeepL 번역 API 써보기 - RAPID API 허브를 통하면 가능(2024.06.종료) (0) | 2023.07.13 |
| stable-ts (Whisper)로 영상 자막을 파이썬 코드로 추출해 보기 및 DeepL 파일 번역 도우미 (73) | 2023.06.06 |