MiniMax liberó MiniMax-H3, un modelo que la compañía describe como "un sistema generativo omnimodal de propósito general". En la práctica eso significa que acepta texto, imágenes, audio y video como entrada, y con ellos genera clips de video de hasta 15 segundos con audio incluido.
Dos días después de esa publicación apareció minimax-h3-mlx, un paquete de Python que porta el modelo a MLX, el framework de aprendizaje automático optimizado para los chips de Apple. Es decir, el modelo deja de requerir una GPU de centro de datos y pasa a correr en un notebook.
¿Qué se necesita para correrlo?
El desarrollador Simon Willison lo puso a andar en un MacBook Pro con chip M5 Max. El procedimiento consiste en clonar el repositorio, descargar los pesos desde Hugging Face y lanzar el script de generación:
# Primero descargar los modelos
uvx --from huggingface_hub hf download MiniMaxAI/MiniMax-H3 \
--include 'FL2VA/*' --exclude 'FL2VA/transformer/*'
uvx --from huggingface_hub hf download pipenetwork/MiniMax-H3-MLX-8bit
# Ahora ejecutar el prompt
uv run --with mlx-vlm \
--with-requirements requirements.txt python scripts/generate.py \
"a rainbow colored skunk leaps over a mossy log in a supermarket" \
-o skunk.mp4 \
-c ~/.cache/huggingface/hub/models--MiniMaxAI--MiniMax-H3/snapshots/fa9c8ab1eaa21c8ae25e7e40b83b2e6002f340af/FL2VA \
-t ~/.cache/huggingface/hub/models--pipenetwork--MiniMax-H3-MLX-8bit/snapshots/3ac52081470b0488921c3ec3ba84a39097bf2361La segunda descarga apunta a una versión cuantizada a 8 bits del modelo, que es la pieza clave para que los pesos quepan en la memoria unificada de un equipo de escritorio en lugar de exigir un servidor.
45 minutos por 15 segundos de video
Acá están los números que conviene mirar antes de intentarlo. La descarga completa de archivos del modelo ocupó cerca de 115 GB, y la generación del video tardó poco menos de 45 minutos.
Puesto en perspectiva, son unos 2.700 segundos de cómputo para producir, como máximo, 15 segundos de material: una relación cercana a 180 a 1 entre tiempo de proceso y tiempo de resultado. Para un flujo de trabajo profesional que necesite iterar sobre una toma, esa cifra manda: cada corrección de encuadre o de acción cuesta la mitad de una jornada de tarde.
El prompt de la prueba fue deliberadamente absurdo, "un zorrillo de colores del arcoíris salta sobre un tronco cubierto de musgo en un supermercado", y el resultado visual fue, según su autor, impresionante.
¿Por qué el audio salió mal?
El punto débil de la prueba no estuvo en la imagen sino en la pista sonora, que resultó ser un balbuceo parecido al habla pero sin contenido. La causa no fue el modelo: fue el prompt.
Al no entregar ninguna indicación sobre qué debía sonar, el sistema improvisó. MiniMax publicó una guía de escritura de prompts con instrucciones específicas para dirigir tanto el video como el audio, documento que en este caso no se consultó antes del experimento. La lección práctica es que en un modelo omnimodal el prompt tiene que cubrir cada modalidad de salida por separado, porque lo que no se especifica el modelo lo rellena por su cuenta.
¿Qué cambia que corra en local?
Para equipos creativos de la región, la posibilidad de generar video en la propia máquina tiene tres consecuencias concretas. Primero, el costo deja de ser por clip generado y pasa a ser el del hardware, ya amortizado si el equipo existe. Segundo, el material de trabajo nunca sale del computador, lo que resuelve de entrada las dudas de confidencialidad con contenido de clientes. Tercero, no hay dependencia de una suscripción en dólares ni de la disponibilidad de un servicio externo.
El precio de esas ventajas está en los 115 GB de almacenamiento y en la espera de 45 minutos por intento. Es una alternativa viable para producción pausada, no para exploración rápida de ideas.




