본문 바로가기

AI

영상 자막 추출과 번역 Kotoba-Whisper와 Tensent Hy-MT2 활용

그 동안 영상 자막 추출기와 번역하는 파이썬 스크립트를 직접 만들기도 했고, 다른 방법을 소개해기도 했었습니다. 

 

기존의 방법들(Faster-Whisper-XXL, stable-ts, Whisper)이 잘 작동하는 듯 하면서도, 어둠의 경로에서 받은 일본의 영상에서는 약간 맥을 못추는 경향이 있었습니다.

 

  • 일반적인 대화가 아닌 경우 자막 추출 시에 유령 음성이 끼거나 자막을 놓치거나 싱크가 맞지 않는 등 다양한 문제
  • 번역의 경우에도 DeepL API나 translategemma도 어느 정도 괜찮은 편이지만, 그냥 호출할 경우 맥락이 약간 없이 번역되는 DeepL이 있고, translategemma는 모아서 보내면 맥락은 생기지만 야한 용어는 번역이 제한되거나 부자연스러운 점 

이번에 Codex가 알려 준 일본에서 만든 Kotoba-Whisper v2.2와 중국에서 만든 Hy-MT2 번역 모델(2026년6월)은 꽤 쓸만한 느낌을 주기에 소개해 보려고 합니다. 

 

아래와 같이 일본어 영상에서 자막을 추출하고, 한국어 자막으로 번역해 주는 파이썬 스크립트를 Codex 5.5 medium이 만들어 주었습니다. 

 

일단은 VRAM이 8GB이상인 엔비디아의 그래픽카드(예: RTX시리즈)와 최신 드라이버가 설치된 윈도우11에서 작동이 됩니다. 이론적으로는 리눅스에서도 작동이 되지만 테스트는 하지 않았습니다. 

 

  • 실리콘칩 M1 이상을 탑재한 맥에서도 사용이 가능합니다. M1에서는 많이 느리기는 합니다만... 

 

아래 테스트는 RTX3090(24GB VRAM)에서 테스트한 모습입니다. 번역에서는 30B모델의 Q4 양자화된 모델을 썼습니다.

 

파이썬으로 간단하게 만든 GUI 화면

사용된 기술

  • 자연스러운 번역을 제공하는 텐센트의 Hy-MT2 번역 모델  
    • Hy-MT2-30B-A3B은 특히 성능이 좋았는데, 300억 파라미터 중 30억 개(Active 3B)만 활성화되는 MoE(전문가 혼합) 아키텍처를 채택해, 대형 모델 수준의 품질과 경량 모델 수준의 속도를 동시에 제공한다고 합니다. 
    • https://github.com/Tencent-Hunyuan/Hy-MT2

사용 소감 

  • 같이 적용된 pyannote의 segmentation-3.0은 음성 구간을 꽤 잘 분할해 주었습니다. 이로 인해, 일본어에 강한 Kotoba-Whisper의 성능을 최대한 활용할 수 있었습니다. 물론, 그 와중에도 영상에 따라 오인식되거나 유령 자막이 없어지지는 않습니다. 그래도 일반 Faster-Whisper-XXL이나 Whisper large모델들, stable-ts보다는 일본어를 잘 인식할 것으로 보입니다. 
  • translategemma는 번역은 잘 하는 편이지만, 특정 단어는 번역을 거부하게 되어 있었습니다. 반면에 Hy-MT2는 제약이 없고 번역을 생각보다 잘 합니다.

설치 방법 

참고 사항 

  • 번역은 로컬 컴퓨터에 별도로 설치한 Ollama의 모델을 이용하게 되는데, 명령어(파워쉘, 터미널 등에서)를 사용하여 "ollama pull 모델명" 방식으로 자신의 컴퓨터의 사양에 맞는 모델을 미리 받아두면 됩니다. 챗지피티나 제미나이에게 컴퓨터 메모리, 그래픽카드 종류를 알려주면 적절한 transslategemma나 Hy-MT2 모델을 추천해 줍니다. 
  • Kotoba는 일본어에만 적용됩니다. Qwen3-ASR은 한국어도 가능합니다. (출력파일명에 .ja.가 붙기는 합니다).
    uv run --no-sync kotoba process --language korean --output-dir ./tmp-output --asr-backend qwe3-mlx 입력파일.wav

관련 과거 글들 

이전에 작성했던 관련 글은 다음과 같습니다.

 

https://imky.tistory.com/146

 

비디오 자막 추출 Faster-Whisper-XXL 사용 방법

비록 UI(사용자 인터페이스)가 없지만 비디오로부터 자막을 추출하는 하나의 방법인 Faster-Whisper-XXL의 사용법을 기록해보겠습니다. Whisper계열 자막 추출 방법 중에는 속도가 가장 빠릅니다. 만약,

imky.tistory.com

 

https://imky.tistory.com/61

 

stable-ts (Whisper)로 영상 자막을 파이썬 코드로 추출해 보기 및 DeepL 파일 번역 도우미

[최신 업데이트 소스 위치]  내용을 계속 수정 보완 중이라서, 최신 내용은 아래 링크를 참고해 주세요.  영상 자막 추출 후 DeepL 앱/웹으로 워드파일을 이용하여 수동 번역을 원할 경우: https:/

imky.tistory.com