Cohere liberó Parse (parse-v5.0), un modelo de análisis documental orientado a la ingesta empresarial de alto volumen. Se trata de un modelo de visión y lenguaje de 2.300 millones de parámetros, con una ventana de contexto de 8.192 tokens y un tamaño aproximado de 4,6GB, construido sobre la arquitectura North-Micro-Vision-Instruct de Cohere Labs.

Parse recibe una página en PDF, PPT o JPEG como URI de datos codificado en base64 y devuelve Markdown que contiene el texto en orden de lectura, tablas renderizadas como HTML, listas, pares clave-valor de formularios, descripciones de imágenes y coordenadas de recuadros delimitadores. No hay una etapa de OCR separada por delante.

Cohere fija el precio de la API de Parse en 1,50 dólares cada mil páginas y posiciona al modelo por relación precio-rendimiento antes que por exactitud máxima, una afirmación que la compañía respalda con un puntaje ParseBench autoinformado de 79,2 que, como se detalla más abajo, mide tres de las cinco dimensiones de ese benchmark.

¿Está disponible para producción?

Sí, en producción. Parse está disponible de forma general a través de la API de Cohere Parse, Microsoft Foundry, AWS SageMaker y el Model Vault de instancia dedicada. No hay lista de espera ni licencia de investigación.

  • Qué empresas: equipos de mercado medio que ya operan una plataforma de recuperación aumentada pueden partir con llamadas medidas a la API usando una clave de prueba gratuita. Las grandes empresas con requisitos de residencia de datos o de aislamiento total van directo a Model Vault o a despliegue privado. Las startups en etapa semilla pueden usarlo, pero la economía recién empieza a importar por sobre las 100 mil páginas mensuales.
  • Qué industrias: Cohere apunta a servicios financieros, seguros, salud y ciencias de la vida, sector público, telecomunicaciones, energía y manufactura, los rubros densos en documentos donde los formularios escaneados y las tablas apretadas son la norma.
  • Aplicaciones: ingesta para recuperación aumentada, procesamiento inteligente de documentos, flujos de siniestros y facturas, búsqueda en contratos y presentaciones regulatorias, y entrega de contexto documental a agentes.

¿Qué es exactamente Parse?

El modelo recupera el texto y el orden de lectura, tablas, listas, formularios y pares clave-valor, imágenes y sus leyendas, y la ubicación de los límites de página y de los elementos visuales, todo en una sola pasada. Hay nueve idiomas listados como estables: árabe, inglés, francés, alemán, italiano, japonés, coreano, portugués y español, con soporte de disparo cero para el resto a menor exactitud.

Dos modos de salida importan en la práctica. El modo por defecto devuelve una cadena de Markdown por página. Configurar output_format="blocks" devuelve bloques tipados, donde un bloque de tabla carga su HTML, su recuadro delimitador y una descripción. Ese segundo modo es el que hace posible la trazabilidad a nivel de citación.

¿Qué dice realmente el puntaje de 79,2?

Cohere reporta un puntaje ParseBench de 79,2 para Parse, promediado entre tablas, fidelidad de contenido y formato semántico, por delante de Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) y Databricks AI Parse (72,4).

ParseBench es un benchmark de LlamaIndex compuesto por unas 2.078 páginas empresariales verificadas por humanos, evaluadas en cinco dimensiones: tablas, gráficos, fidelidad de contenido, formato semántico y anclaje visual. La cifra de Cohere promedia tres de ellas y descarta gráficos y anclaje visual, justamente las dos dimensiones donde la mayoría de los analizadores documentales se derrumba.

Frente a la tabla de posiciones pública, los mismos proveedores puntúan bastante más abajo en el total de cinco dimensiones: Mistral OCR 4 con 60,68, Databricks AI Parse con 60,68 y Azure Document Intelligence (Layout) con 59,64. El promedio de tres dimensiones de Azure da exactamente 74,3, lo que coincide con la cifra de Cohere y confirma la metodología. Cohere Parse no aparece actualmente en esa tabla, donde LlamaParse Agentic lidera con 84,88.

Así que 79,2 es un puntaje de subconjunto reportado por el propio proveedor, no una posición en la tabla. Es una afirmación razonable, y conviene ponerla a prueba con documentos propios.

¿Cuánto cuesta y cuándo conviene la instancia dedicada?

Cohere fija el precio de la API de Parse en 1,50 dólares cada mil páginas. En Model Vault, Parse 5 cuesta 4,00 dólares por hora o 2.500 dólares mensuales para una instancia Medium, y 7,00 dólares por hora o 4.300 dólares mensuales para la XL.

El punto de cruce que nadie publica: a 0,0015 dólares por página, una sola instancia Medium alcanza el equilibrio alrededor de 1,67 millones de páginas mensuales, y la XL cerca de 2,87 millones. Por debajo de eso, las llamadas medidas a la API salen más baratas. Por encima, la capacidad dedicada gana solo por precio, antes de cualquier discusión sobre residencia de datos, que suele ser la verdadera razón por la que las empresas se mueven a Vault.

Conviene aterrizar esas cifras a una escala regional. Un estudio jurídico o una corredora que digitalice 20 mil páginas al mes gasta 30 dólares mensuales por la API, y necesitaría multiplicar su volumen por más de ochenta antes de que la instancia dedicada tenga sentido económico. Para la enorme mayoría de las operaciones en Chile y el resto de América Latina, la conversación sobre Model Vault no es de costo, es de dónde quedan alojados los datos.

Que el español figure entre los nueve idiomas estables tampoco es un detalle menor. Buena parte de los modelos de análisis documental declaran soporte multilingüe pero se calibran sobre corpus en inglés, y el resultado típico es que las tablas y los formularios escaneados en español pierden estructura.

Puntos clave

  • Cohere lanzó parse-v5.0, un modelo de visión y lenguaje de 2.300 millones de parámetros que convierte PDF, diapositivas e imágenes en Markdown con tablas en HTML y recuadros delimitadores.
  • El precio de la API es de 1,50 dólares cada mil páginas; Model Vault cuesta 2.500 dólares mensuales (Medium) o 4.300 dólares mensuales (XL).
  • La capacidad dedicada solo le gana al precio medido por sobre 1,67 millones de páginas mensuales, aproximadamente.
  • La cifra de 79,2 en ParseBench es autoinformada, cubre tres de cinco dimensiones y omite gráficos y anclaje visual.

Los detalles técnicos están acá y el modelo se puede probar en Hugging Face.