Una industria de miles de millones escondida detrás de una extensión.
El análisis de PDF no se reporta como un mercado independiente, así que el titular requiere precisión. Pero el ecosistema creado para hacer útiles los PDF —desde software documental hasta infraestructura de ingesta para IA— vale indiscutiblemente miles de millones.
Señales del mercado
La categoría ya se financia, se cobra y opera a escala.
$3.18B Ingresos de Adobe Document Cloud en 2024
$3.48B ARR final de Adobe Document Cloud
$27.5M Capital total levantado por LlamaIndex
3M+ Descargas mensuales de LlamaIndex
5M+ Descargas de Unstructured open source
$0.03 Precio por página de Unstructured
1B+ Páginas procesadas por Reducto
$108M Financiación reportada por Reducto
En esta historia
01 Los PDF preservan la apariencia, no la comprensión.02 La precisión, la velocidad y buenas APIs rara vez llegan juntas.03 Hacer que el propio motor esté a la altura del flujo de trabajo.
01 El formato
Los PDF preservan la apariencia, no la comprensión.
document.pdf
apariencia ≠ significado
PDF 2.0 tiene 1.003 páginas y no cuenta con una implementación de referencia. La especificación define archivos válidos, pero no indica cómo recuperar los que están malformados. Cada analizador debe decidir cuándo rechazar, reparar o hacer una inferencia razonable.
El formato tampoco ofrece una capa semántica confiable. El orden de lectura, los párrafos, encabezados, tablas e incluso los espacios pueden tener que reconstruirse a partir de fuentes, instrucciones de dibujo y coordenadas.
02 La brecha
La precisión, la velocidad y buenas APIs rara vez llegan juntas.
parser.matrix
parser
precisión
velocidad
API / DX
integridad precisión · confiabilidad
motor rendimiento
producto UX · usabilidad
interfaz DX · ergonomía
core pdf
¿elige dos? diseñado en conjunto.
Core PDF comienza con una negativa: no estamos dispuestos a cambiar precisión por velocidad, confiabilidad por usabilidad ni rendimiento por una API ergonómica. Esas cualidades deben diseñarse como un solo sistema.
Los analizadores existentes no son universalmente malos; toman decisiones distintas. Algunos priorizan la edición, otros el texto, el renderizado o salidas preparadas para IA. La cobertura puede fallar con fuentes difíciles, páginas escaneadas, tablas anidadas, referencias cruzadas inusuales o archivos dañados.
A escala, esas decisiones se convierten en problemas de producto: ingesta lenta, picos de memoria, omisiones silenciosas, orden de lectura alterado y múltiples capas de código alternativo. Los desarrolladores heredan APIs fragmentadas y deben traducir conceptos internos del analizador a los resultados simples que sus aplicaciones realmente necesitan.
El mercado lo demuestra: LlamaIndex creó LlamaParse para documentos complejos, Unstructured vende transformación por página y Reducto ha levantado capital significativo alrededor de la inteligencia documental. Validan la necesidad, aunque operan principalmente en una capa alojada y asistida por IA.
03 Nuestra apuesta
Hacer que el propio motor esté a la altura del flujo de trabajo.
core-pdf
01 bytes 02 analizar 03 layout 04 resultado
TXT MD ▦ IMG
Core PDF es nuestro esfuerzo por hacer que trabajar con PDFs se sienta sencillo. Debe comprender documentos reales y desordenados, entregar resultados útiles con rapidez y ofrecer a los desarrolladores una API predecible desde la primera llamada.
Lo estamos construyendo alrededor de resultados que cualquiera pueda comprobar: si maneja correctamente PDFs difíciles, qué tan rápido funciona y qué tan fácil es usarlo. Publicaremos benchmarks y resultados de compatibilidad a medida que madure.
Resultados confiables, incluso con PDFs desordenados Rapidez para cargas de trabajo exigentes Una API clara que los desarrolladores disfruten usar