
Developers e integradores de API
Integre via MiniMax API (`MiniMax-H3`), Vercel AI Gateway, fal.ai ou self-host de pesos abertos. Uma única arquitetura gere T2V, I2V, reference e editing.
MiniMax H3 é um sistema generativo omni-modal de propósito geral — um modelo de 33B parâmetros que compreende texto, imagens, vídeo e áudio num contexto unificado, gerando vídeo 2K com som estéreo nativo num único forward pass.
Detailed scene timing, reference instructions and audio cues can be written directly in the prompt.
Start from a prompt, animate one or two frames, or combine image, video and audio references.
MiniMax H3 quebra o domínio do código fechado com pesos abertos, relação preço-desempenho líder na indústria e arquitetura de generalização de tarefas construída para o ecossistema aberto.
Os pesos H3-Base são publicados no Hugging Face sob a MiniMax Community License — permitindo uso comercial para organizações com receita inferior a $20M. Construa versões personalizadas em diversos hardware de IA.
Um Transformer denso de fluxo único de 33B parâmetros com ~20B parâmetros ativos em inferência. Usa Qwen3-VL-32B como encoder, 3D multimodal RoPE e separa o compute de compreensão/geração para 30% mais throughput de treino.
A linguagem actua como ponte unificando tarefas numa forma aberta e descritiva. Descreva relações entre o contexto multimodal e o vídeo alvo em linguagem natural — H3 gere a compreensão full-modality.
Em vez de super-resolution convencional, H3 regenera a sua própria saída 768p in-context a 2K — recuperando detalhes finos como texto pequeno que upscalers não conseguem restaurar.
Siga estes passos para começar a gerar com MiniMax H3 usando o gerador desta página ou a MiniMax API.
Seleccione text-to-video para geração apenas com prompt, first/last-frame para image-to-video, ou reference-to-video para fluxos omni-reference com até 12 ficheiros de entrada mistos.

MiniMax H3 serve developers, estúdios e criadores que precisam de vídeo IA aberto, controlável e de grau produção com compreensão multimodal.

Integre via MiniMax API (`MiniMax-H3`), Vercel AI Gateway, fal.ai ou self-host de pesos abertos. Uma única arquitetura gere T2V, I2V, reference e editing.

Destaca-se em seguimento de instruções, renderização precisa de texto e marca, e V2V motion transfer. Construído para anúncios, product design, UI/UX e conteúdo gaming.

Fine-tune, personalize e implemente no seu próprio hardware. Compatível com uma ampla gama de aceleradores de IA — compatibilidade de hardware foi uma consideração chave de design.
Escreva um prompt ou anexe referências multimodais, e MiniMax H3 gera vídeo 2K com áudio estéreo nativo — diálogo, SFX e ambience num único passo.
O design de generalização de tarefas do MiniMax H3 oferece amplas capacidades multimodais desde a fase de pretraining.
Um transformer gere text-to-video, image-to-video, reference-to-video, video editing e audio generation — sem modelos T2V, I2V e TTS separados unidos.
Geração conjunta de vídeo e áudio num forward pass a 32kHz stereo. Voz, efeitos sonoros e música modelados conjuntamente — sem separação entre domínios de áudio.
Durações de saída de 4 a 15 segundos a 24 frames per second. Proporções de 2:5 a 5:2, cobrindo formatos cinematográficos widescreen e verticais para redes sociais.
Tokenizer completamente renovado com melhorias na qualidade de reconstrução em todos os aspectos. 4x de ganho em effective sequence length — tecnologia chave por trás do suporte nativo 2K.
Suporta Arabic, Chinese, English, French, German, Italian, Japanese, Korean, Portuguese, Russian e mais — com diferentes graus de suporte de idioma de áudio.
A 2K, o preço por segundo é menos de um terço dos modelos mainstream (~0.80 CNY/sec). A 768p, menos de metade do preço de ofertas mainstream 720p.
Classificado como o modelo IA mais poderoso do mundo em video editing nos benchmarks Artificial Analysis — apenas atrás em T2V puro face a Gemini e Seedance.
Da arquitetura omni-modal aberta do MiniMax H3 à geração de 30 segundos do Wan 3.0 e qualidade cinematográfica do Google Veo.

Modelo omni-modal open-weight de 33B com áudio estéreo 2K nativo e edição baseada em instruções.

Marca consumer da MiniMax para H3 — 2K nativo, áudio sincronizado e controlo omni-reference.

Modelo de vídeo multimodal de 30 segundos da Alibaba com conversão document-to-video.

Vídeo IA cinematográfico do Google DeepMind com 4K e áudio nativo.
Mergulhos profundos na arquitetura H3, integração API e fluxos criativos.
Ainda tem dúvidas? Estamos aqui para ajudar.