미니맥스 H3 Hugging Face 오픈소스: 다운로드·로컬 실행·2K 워크플로 정리
미니맥스 H3가 Hugging Face에 공개됐습니다. 다운로드 방법부터 H3-Base 로컬 실행, FL2VA·Ref2VA, 768p와 2K 워크플로의 차이까지 한 번에 정리합니다.
MiniMax H3 Hugging Face, 지금 받을 수 있나요?
네. MiniMax H3는 현재 Hugging Face에서 공식 가중치를 내려받을 수 있습니다. 공식 저장소는 MiniMaxAI/MiniMax-H3이며, Hugging Face CLI를 사용하면 다음 명령으로 받을 수 있습니다.
hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3다만 여기서 한 가지는 구분해야 합니다. Hugging Face에 올라온 H3-Base만 로컬로 실행하는 것과 MiniMax가 제공하는 전체 2K 파이프라인을 재현하는 것은 같은 일이 아닙니다.
현재 로컬 H3-Base는 768p 음성·영상 생성을 담당하고, 완전한 2K 워크플로에는 H3-Context-IR과 H3-Regenerate-2K API가 함께 사용됩니다. 아래 내용은 2026년 8월 20일 공식 모델 카드 기준입니다.
먼저 보는 핵심 정리
| 궁금한 점 | 현재 상태 |
|---|---|
| MiniMax H3 공식 Hugging Face 저장소가 있나요? | 있습니다. MiniMaxAI/MiniMax-H3입니다. |
| 가중치를 직접 다운로드할 수 있나요? | 가능합니다. Hugging Face CLI로 내려받을 수 있습니다. |
| 어떤 체크포인트가 공개됐나요? | H3-Base FL2VA와 Ref2VA가 공개됐습니다. |
| 로컬 H3-Base 출력은 몇 p인가요? | 기본 로컬 검증 워크플로는 768p입니다. |
| 2K도 완전 로컬로 가능한가요? | 현재 공식 2K 검증 흐름은 로컬 H3-Base와 MiniMax API를 함께 사용합니다. |
| 오디오도 같이 생성하나요? | 네. H3는 네이티브 스테레오 오디오를 함께 생성합니다. |
MiniMax H3 오픈소스에서 실제로 공개된 것
MiniMax H3는 텍스트만 받는 단일 영상 모델이 아니라, 텍스트·이미지·영상·오디오를 함께 이해하는 멀티모달 생성 시스템입니다. 공식 모델 카드 기준 출력 길이는 4~15초이며, 24 FPS와 32 kHz 스테레오 오디오를 지원합니다.
전체 H3 시스템은 크게 세 부분으로 나뉩니다.
- H3-Context-IR: 여러 입력을 해석하고 H3가 처리하기 좋은 구조로 정리하는 전처리·오케스트레이션 단계입니다.
- H3-Base: 실제 영상과 오디오를 생성하는 베이스 모델입니다. 로컬 검증 기준 출력은 768p입니다.
- H3-Regenerate-2K: 768p 결과와 원래 컨텍스트를 다시 사용해 2K 결과를 재생성하는 단계입니다.
Hugging Face 공개의 중심은 H3-Base입니다. 현재 공식 저장소에는 두 가지 주요 체크포인트가 있습니다.
| 체크포인트 | 용도 | 입력 | 출력 |
|---|---|---|---|
| H3-Base FL2VA | 텍스트→영상, 시작/마지막 프레임 기반 영상 | 텍스트 + 선택적 시작·마지막 이미지 | 영상 + 오디오 |
| H3-Base Ref2VA | 레퍼런스 기반 영상 생성 | 텍스트 + 이미지·영상·오디오 레퍼런스 | 영상 + 오디오 |
각 체크포인트에는 processor, tokenizer, text_encoder, transformer, visual_vae, audio_vae 등 실행에 필요한 구성요소가 함께 포함됩니다.
완전히 오픈소스된 것은 어디까지인가요?
여기서 가장 많이 헷갈리는 부분이 있습니다. H3-Base 가중치는 공개됐지만, 전체 H3 2K 시스템이 모두 로컬 오픈소스로 풀린 것은 아닙니다.
공식 설명에 따르면 H3-Context-IR은 여러 호스팅 모델과 서비스를 사용하는 다단계 시스템이라 이번 오픈소스 릴리스에 포함되지 않았습니다. 대신 공식 API가 제공됩니다.
2K 결과도 단순 업스케일이 아니라 H3-Regenerate-2K 단계에서 다시 생성합니다. 현재 공식 2K 검증 방법은 로컬 H3-Base에 MiniMax의 Context-IR·Regenerate-2K API를 조합하는 방식입니다.
MiniMax H3 다운로드와 로컬 실행 방법
가장 먼저 공식 저장소를 내려받습니다.
hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3MiniMax는 공식 모델 카드에서 SGLang, vLLM, Diffusers, ComfyUI 등 여러 실행 경로를 안내하고 있습니다.
백엔드 서비스로 붙이려면 SGLang이나 vLLM이 편하고, 노드 기반으로 빠르게 테스트하려면 ComfyUI가 접근하기 쉽습니다.
FL2VA와 Ref2VA, 무엇을 고르면 되나요?
FL2VA는 텍스트만으로 영상을 만들거나 시작 프레임·마지막 프레임을 지정해 흐름을 제어하고 싶을 때 적합합니다.
반면 Ref2VA는 여러 이미지, 영상, 오디오를 참고 자료로 넣고 캐릭터·스타일·동작·사운드 같은 요소를 더 강하게 유지하고 싶을 때 유용합니다.
간단히 나누면 다음과 같습니다.
| 목표 | 추천 방식 |
|---|---|
| 텍스트만으로 영상 만들기 | FL2VA |
| 시작 이미지에서 영상 만들기 | FL2VA |
| 시작·마지막 장면을 지정하기 | FL2VA |
| 여러 레퍼런스를 함께 사용하기 | Ref2VA |
| 캐릭터·스타일·오디오를 참고시키기 | Ref2VA |
GPU 환경을 직접 구성하기 전 결과부터 보고 싶다면 미니맥스 H3 AI 비디오 생성기에서 먼저 프롬프트와 장면 구성을 테스트하는 편이 빠릅니다.
768p 로컬 실행과 2K 워크플로의 차이
H3를 처음 보는 개발자라면 이 차이를 먼저 이해하는 게 좋습니다.
로컬 H3-Base
H3-Base만 로컬에 올리면 공식 재현 예제 기준으로 768p 결과를 만들 수 있습니다. 텍스트→오디오·영상, 시작/마지막 프레임 기반 생성, 레퍼런스 기반 생성 모두 이 단계에서 검증할 수 있습니다.
전체 2K 워크플로
2K가 필요하면 과정이 하나 더 붙습니다. MiniMax 공식 흐름은 다음과 같습니다.
- H3-Context-IR이 입력된 텍스트·이미지·영상·오디오를 정리합니다.
- 로컬 H3-Base가 768p 영상과 오디오를 생성합니다.
- H3-Regenerate-2K가 원래 컨텍스트와 768p 결과를 다시 받아 2K로 재생성합니다.
즉, 현재 기준으로 "MiniMax H3를 다운로드했다 = 전체 2K 파이프라인을 완전히 오프라인으로 돌릴 수 있다"는 뜻은 아닙니다.
로컬 제어가 가장 중요하다면 H3-Base부터 시작하고, 실제 서비스에서 2K 품질이 필요할 때 API 혼합 방식을 검토하는 편이 현실적입니다.
MiniMax H3 오픈소스가 특히 유용한 경우
H3는 단순히 예쁜 짧은 영상을 만드는 데서 끝나지 않고, 영상과 소리를 같이 다루는 워크플로에 강점이 있습니다.
- 제품 소개 및 이커머스 영상
- SNS 광고와 숏폼 콘텐츠
- 시작·마지막 프레임을 지정한 이미지→영상
- 여러 레퍼런스를 활용한 캐릭터·스타일 유지
- 영상과 효과음·배경음을 한 번에 생성하는 실험
- 내부 GPU 환경에서 반복 테스트해야 하는 제품팀
- ComfyUI 기반의 노드 워크플로를 만드는 크리에이터
시작하기 전에 확인할 점
첫째, 하드웨어 요구사항이 가볍지 않습니다. 공식 예제는 멀티 GPU 구성을 전제로 한 serving 설정을 제공합니다. 일반 노트북에서 간단히 돌리는 소형 모델과는 성격이 다릅니다.
둘째, 2K까지 로컬에서 끝내려는 경우에는 현재 공식 공개 범위를 다시 확인해야 합니다. H3-Base는 공개됐지만 H3-Context-IR은 API 기반이며, 공식 2K 검증도 API 혼합 흐름을 사용합니다.
셋째, 라이선스를 확인해야 합니다. MiniMax H3는 일반적인 MIT나 Apache 라이선스가 아니라 MiniMax H3 Community License Agreement를 사용합니다. 상업적 서비스, 재배포, 파인튜닝에 넣기 전에 최신 라이선스 조건을 읽어 보는 것이 좋습니다.
MiniMax H3 Hugging Face FAQ
MiniMax H3는 Hugging Face에 공식 공개됐나요?
네. MiniMax 공식 조직 계정의 MiniMaxAI/MiniMax-H3 저장소에서 모델 카드와 가중치를 확인할 수 있습니다.
MiniMax H3 가중치는 어떻게 받나요?
Hugging Face CLI에서 아래 명령을 실행하면 됩니다.
hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3MiniMax H3는 완전히 오픈소스인가요?
H3-Base 체크포인트와 관련 구성요소는 공개되어 있습니다. 다만 전체 시스템의 H3-Context-IR은 이번 오픈소스 릴리스에 포함되지 않았고 공식 API로 제공됩니다.
로컬에서 2K 영상을 만들 수 있나요?
H3-Base만 사용하는 공식 로컬 검증 흐름은 768p입니다. 공식 2K 워크플로는 로컬 H3-Base와 H3-Context-IR·H3-Regenerate-2K API를 함께 사용합니다.
MiniMax H3는 오디오도 같이 생성하나요?
네. 공식 사양은 32 kHz 스테레오 오디오 출력을 명시하고 있습니다. 영상과 소리를 별도 단계로 만드는 대신 한 생성 흐름에서 처리할 수 있다는 점이 H3의 특징입니다.
ComfyUI에서도 사용할 수 있나요?
가능합니다. 공식 모델 카드에서 ComfyUI 리소스와 템플릿을 안내하고 있습니다. 코드로 serving 환경을 구성하는 것보다 노드 방식이 익숙하다면 좋은 시작점입니다.
FL2VA와 Ref2VA의 차이는 무엇인가요?
FL2VA는 텍스트와 시작·마지막 프레임을 중심으로 영상을 만드는 체크포인트입니다. Ref2VA는 이미지·영상·오디오 같은 여러 레퍼런스를 함께 활용하는 작업에 맞춰져 있습니다.
정리
MiniMax H3 Hugging Face 공개는 단순한 모델 카드 업데이트가 아닙니다. 개발자가 H3-Base 가중치를 직접 내려받아 768p 음성·영상 생성 흐름을 검증하고, SGLang·vLLM·Diffusers·ComfyUI 같은 도구에 연결할 수 있게 됐다는 의미가 큽니다.
다만 현재 공개 범위를 정확히 보는 것이 중요합니다. H3-Base는 로컬 실행이 가능하지만, 공식 전체 2K 워크플로는 아직 MiniMax API와 결합됩니다.
먼저 결과를 확인하고 싶다면 미니맥스 H3 AI 비디오 생성기에서 영상 생성을 테스트해 보고, 직접 배포가 필요할 때 Hugging Face의 H3-Base로 넘어가는 흐름이 가장 부담이 적습니다.
참고 자료
- MiniMaxAI/MiniMax-H3 공식 Hugging Face 저장소
- 공식 모델 카드 기준: 4~15초, 24 FPS, 32 kHz 스테레오 오디오, H3-Base 768p 로컬 검증
- 공식 2K 검증 흐름: 로컬 H3-Base + H3-Context-IR API + H3-Regenerate-2K API
- 라이선스: MiniMax H3 Community License Agreement
Newsletter
Join the community
Subscribe to our newsletter for the latest news and updates
