Una página de PDF es una lista de instrucciones de dibujo, no un archivo de diseño
El flujo de contenido de un PDF contiene operadores para dibujar texto, trazados y recursos de imagen. El extractor sigue esas referencias y decodifica el objeto asociado. También puede haber imágenes dentro de formularios, máscaras u otras estructuras anidadas; la cobertura depende de cómo recorra el archivo la herramienta.
No siempre se puede recuperar el archivo original
PDF admite varias codificaciones, como JPEG, JPEG 2000, CCITT, color indexado y muestras sin comprimir. Algunos flujos JPEG pueden copiarse directamente, pero otros deben convertirse primero en píxeles y a un espacio de color. En esos casos se genera un archivo nuevo, no una copia exacta de los bytes originales.
Por qué específicamente PNG y no siempre JPEG
Una vez que una imagen se decodifica en píxeles simples, volver a guardarla necesita un formato capaz de contener exactamente esos datos sin una segunda ronda de compresión con pérdida encima de la que ya pudo haber ocurrido durante la codificación original del propio PDF. PNG no tiene pérdida por diseño; almacena los píxeles tal cual, sean los que sean, sin volver a adivinar ni descartar detalle. Volver a exportar como JPEG en ese punto significaría comprimir datos ya decodificados por segunda vez, añadiendo artefactos nuevos que no estaban en la fuente. Que PNG sea más grande en tamaño de archivo es la contrapartida de no hacer eso.
Un objeto puede reutilizarse en varias páginas
Los generadores de PDF suelen reutilizar una sola imagen incrustada en muchas páginas; un logotipo de encabezado repetido o un gráfico de membrete son ejemplos comunes; específicamente para que el archivo no tenga que incrustar docenas de copias idénticas de la misma imagen. Una herramienta que extrae imágenes puede aprovechar esa misma estructura: cuando la misma imagen subyacente se referencia desde varias páginas, solo necesita decodificarse y ofrecerse para descarga una vez, con una nota de en qué páginas aparece, en lugar de una vez por aparición.
Límites que conviene conocer
¿Por qué no salió ninguna imagen de mi PDF? Si el PDF se creó completamente con texto y gráficos vectoriales; formas, líneas y degradados descritos como trazos en lugar de fotos; no hay ningún dato de imagen ráster en ninguna parte que extraer, aunque la página parezca visualmente contener gráficos.
¿Puede la extracción recuperar una versión de mayor resolución que la que se muestra en la página? No; solo puede recuperar la resolución que realmente se incrustó en el PDF. Si la imagen de origen ya estaba reducida o muy comprimida antes de colocarse en el PDF, ese es el límite de lo que puede salir.
Un escaneo suele ser una imagen grande por página. El resultado puede ser la página completa, no cada fotografía que se vea dentro de ella.
Extrae las imágenes de un PDF
Extraer Imágenes de un PDF de Orisod encuentra imágenes incrustadas compatibles y las exporta como PNG, por separado o en un ZIP, sin subir el documento.
Extraer imágenes →La versión corta: un PDF no contiene una carpeta de archivos de imagen esperando ser copiados; contiene instrucciones para pintar píxeles, y extraer una imagen significa realmente ejecutar suficientes de esas instrucciones para obtener datos de píxeles reales, y luego guardar esos datos en un formato diseñado para contenerlos sin pérdida. PNG no es una limitación de ninguna herramienta en particular; es el resultado natural de ese proceso.