
Gemini Omni de Google convierte imagen, audio y texto en video
Anunciado en Google I/O 2026, Omni Flash genera clips de 10 segundos con avatares verificables, marca de agua SynthID y razonamiento conjunto sobre múltiples modalidades.
Todas las notas publicadas en MechaNoticias. Ordenadas por fecha de publicación, de la más reciente a la más antigua.
1.102 notas · Página 46 de 46

Anunciado en Google I/O 2026, Omni Flash genera clips de 10 segundos con avatares verificables, marca de agua SynthID y razonamiento conjunto sobre múltiples modalidades.

Un modelo de propósito general, sin asistente formal tipo Lean, descartó una conjetura de geometría discreta abierta desde 1946 con un cómputo estimado en 32 horas.

El primer release de la familia es 3.5 Flash, líder en agentes y coding sobre su antecesor Pro, con velocidad cuatro veces mayor que otros modelos frontier.

El modelo más rápido en su clase de inteligencia consume tantos tokens en tareas de agentes que supera incluso al Gemini 3.1 Pro en costo total.

El formulario S-1 que SpaceX presentó ante la SEC fija el contrato en USD 1.250 millones mensuales hasta mayo de 2029 por acceso a Colossus, los data centers que originalmente armó xAI.

La china Deepseek monta un equipo "Harness" en Beijing para construir su propio agente de programación, en competencia directa con los productos de Anthropic, OpenAI y Cursor.

La función arranca como early release con foco en utilidades personales, apps que usan cámara o GPS, y experiencias basadas en Gemini API. Google Play mantendrá sus estándares de revisión.

El blueprint expone un servidor de investigación profunda como skill enchufable para Claude Code, Codex y OpenCode, manteniendo los datos sensibles dentro de la red corporativa.

El investigador de Google compartió la guía más concreta hasta la fecha para entrar a OpenAI, Anthropic o DeepMind, y la prueba real son dos ejercicios prácticos sobre MoE y Pallas.

Google rehízo la aplicación desde cero con un lenguaje visual llamado Neural Expressive y un resumen matinal personalizado que cruza Gmail, Calendar y tareas.

El nuevo agente personal de Google llega en beta la próxima semana al plan AI Ultra de 100 dólares mensuales, con permisos para leer Gmail, Calendar y la tarjeta de crédito del usuario.

Coding agentic con orquestación multiagente, comandos por voz y exportación a AI Studio. La nueva versión usa Gemini 3.5 Flash y compite directo con Cursor y Claude Code.

DeepMind libera Hypothesis Generation, Computational Discovery y Literature Insights en Google Labs, con más de 100 instituciones validando y papers publicados hoy en Nature.

Simon Willison desarma el lanzamiento: GA sin preview, USD 1,50 input y USD 9 output por millón de tokens, cerca del 3.1 Pro mientras Google lo regala en sus productos de consumo.

DeepMind libera el primer modelo de la familia Omni a suscriptores AI Plus, Pro y Ultra. Combina imagen, audio, video y texto, con marca SynthID en cada clip y avatares con tu propia voz.

Instructivos portables auditados por SkillSpector y firmados con OpenSSF Model Signing para extender agentes IA con CUDA-X, AI Blueprints y cuOpt sin perder cadena de custodia.

El update anual incluye reconocimiento de voz on-device para cualquier video, descripciones de imágenes mejoradas, control por voz natural en Mac y un Magnifier potenciado en Vision Pro.

El keynote del 19 de mayo trajo el nuevo Gemini Omni para video generativo, un rediseño Neural Expressive de la app, baja del plan Ultra y un competidor de Anthropic Mythos llamado CodeMender.

El developer británico, autor de Datasette, presentó en PyCon US 2026 una lightning talk sobre el punto de inflexión de noviembre de 2025, cuando los agentes de código cruzaron la barrera de calidad.

Jensen Huang anunció en Dell Technologies World la integración de la arquitectura en el PowerEdge XE9812, sumando servidores HGX Rubin NVL8 de 144 GPU por rack y CPUs Vera con 1,2 TB/s de memoria.

El nuevo delegado MLX lleva inferencia GPU optimizada a Mac con chips de Apple, con soporte para Llama, Qwen, Gemma, Whisper y cuantización de 2 a 8 bits, además de NVFP4.

Un consorcio de 64 matemáticos diseñó 439 tareas para Gemini 3 Pro, GPT-5 y Claude Opus 4.5; ninguno supera el 50% al detectar problemas sin solución.