Saltar al contenido principal
Explorar documentación
En esta página
Ver Markdown~1k tokensDescargar Markdown~1k tokens

Extraer de PDF

Usa este extractor para archivos .pdf. Puede extraer imágenes, páginas renderizadas, texto, Markdown, archivos incrustados, metadatos del PDF, enlaces, anotaciones, campos de formulario y fuentes en un resultado ZIP.

Probar Extraer de PDF en el navegador ->

Extract.FAST usa esta misma API: lo que ves en el navegador es lo que obtienes en el código.

Referencia rápida

CampoValor
Tipo de archivo origen.pdf
Grupo origendocumentos
Endpoint de envíoPOST https://api.tools.fast/extract
Endpoint de estimaciónPOST https://api.tools.fast/extract/estimate/pdf
ResultadoDescarga ZIP
Capacidades predeterminadaspdf.images, pdf.pages, pdf.text, pdf.markdown, pdf.embeddedFiles, pdf.metadata, pdf.links, pdf.annotations, pdf.forms, pdf.fonts
Tamaño máximo de archivofree: 50 MB; pro: 2048 MB
Límites de documentofree: 2000 unidades de documento; pro: 2000 unidades de documento
Límites de duraciónNo aplica

Capacidades

CapacidadPredeterminadaOpcionesPrecioDescripción
pdf.imagesNingunaIncluidoImágenes incrustadas en el PDF guardadas por separado.
pdf.pagesNingunaIncluidoPáginas completas del PDF renderizadas como imágenes.
pdf.textNingunaIncluidoTexto seleccionable del PDF guardado por página.
pdf.markdownNingunaIncluidoMarkdown generado desde texto de PDF.
pdf.embeddedFilesNingunaIncluidoArchivos incrustados en el PDF guardados por separado.
pdf.metadataNingunaIncluidoMetadatos del documento PDF para auditoría.
pdf.linksNingunaIncluidoAnotaciones de enlaces del PDF para revisión.
pdf.annotationsNingunaIncluidoComentarios y marcas del PDF cuando estén presentes.
pdf.formsNingunaIncluidoDatos de campos de formulario del PDF cuando estén disponibles.
pdf.fontsNingunaIncluidoFuentes incrustadas del PDF cuando estén presentes.

Salida de metadatos

La capacidad pdf.metadata escribe metadata/pdf.json y metadata/pdf.csv. Los campos de información del documento, como título, autor, creador, productor y palabras clave, se mantienen como cadenas. Los campos de fecha del PDF, como CreationDate y ModDate, se emiten como objetos legibles con display, raw, local, offset, timezoneKnown, precision y parseStatus; los valores con hora completa y zona horaria conocida también incluyen isoUtc.

JSON de opciones con todas las capacidades

Usa esta estructura cuando quieras configurar explícitamente todas las salidas compatibles con este tipo de archivo.

{
  "extraction": {
    "selectedCapabilities": [
      "pdf.images",
      "pdf.pages",
      "pdf.text",
      "pdf.markdown",
      "pdf.embeddedFiles",
      "pdf.metadata",
      "pdf.links",
      "pdf.annotations",
      "pdf.forms",
      "pdf.fonts"
    ],
    "includeManifest": true
  }
}

Ejemplo de estimate

curl -sS -X POST "https://api.tools.fast/extract/estimate/pdf" \
  -H "X-Fast-Api-Key: $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "fileSizeMb": 10,
  "pageCount": 12,
  "options": {
    "extraction": {
      "selectedCapabilities": [
        "pdf.images",
        "pdf.pages",
        "pdf.text",
        "pdf.markdown",
        "pdf.embeddedFiles",
        "pdf.metadata",
        "pdf.links",
        "pdf.annotations",
        "pdf.forms",
        "pdf.fonts"
      ],
      "includeManifest": true
    }
  }
}'

Ejemplo de extract con todas las opciones configuradas

curl -sS -X POST "https://api.tools.fast/extract" \
  -H "X-Fast-Api-Key: $API_KEY" \
  -F "[email protected]" \
  -F 'options={
  "extraction": {
    "selectedCapabilities": [
      "pdf.images",
      "pdf.pages",
      "pdf.text",
      "pdf.markdown",
      "pdf.embeddedFiles",
      "pdf.metadata",
      "pdf.links",
      "pdf.annotations",
      "pdf.forms",
      "pdf.fonts"
    ],
    "includeManifest": true
  }
}'

Descubrimiento legible por máquina

GET /options/pdf
GET /extractors/pdf
Copiado