Document Text Extraction Worker
Il worker accetta il contratto universale ProcessingArtifactV1: scarica il contenuto tramite un accesso opaco, estrae testo nativo o OCR e consegna il risultato all'outputTarget. Non conosce utente, verticale, storage o schema dati. Il percorso legacy File rimane disponibile durante la migrazione e continua a passare da data-service.
Stato: operativo. Coda: document.text.extract.
Estrae il text layer selezionabile dai PDF e usa Google Vision OCR come fallback quando configurato e necessario. Recupera il documento da docs-service e salva testo, metriche e stato tramite data-service con JWT interno contenente il contesto utente/documento.
Risultati
- testo estratto e suddivisione per pagina;
- metodo utilizzato, inclusa l'eventuale OCR;
- qualità e metriche disponibili;
- artefatti e output del task versionati per audit e Admin Interface.
Il worker non vettorializza direttamente: il control plane passa il contributo completato a document-knowledge-indexing-worker. Può lavorare in parallelo all'estrazione visuale.
Configurazione: TEXT_EXTRACTION_CONCURRENCY, risolta nell'ordine DB, ambiente, default 1.