Catalogo → CSV

Carica un catalogo prodotti in PDF. Ricevi un file CSV con una riga per articolo e colonne per codice, nome, attributi e prezzo — e, soprattutto, il conto dei codici: quanti codici articolo porta il PDF, quanti ne sono arrivati nel file e quali mancano, con il loro nome. È la domanda che ti fai prima di importare un catalogo in un e-commerce o in un gestionale, e qui ha una risposta scritta invece di un controllo a mano.

Esempio di risultato reale

Costo: 2 crediti · ≈ €1,80 per elaborazione. La prima elaborazione è gratuita con i crediti di benvenuto. Se poi vuoi continuare, la ricarica minima è di €3,90; i crediti non scadono. I crediti vengono trattenuti all'avvio e restituiti per intero se l'elaborazione non riesce.

  • Se l'elaborazione fallisce, i crediti tornano indietro da soli.
  • Il file caricato resta privato, fuori dal web, e viene eliminato automaticamente: subito dopo un'elaborazione riuscita, entro pochi giorni in ogni altro caso.
  • Ogni risultato passa controlli automatici, con livello di confidenza indicato.
  • Questo strumento invia a OpenAI il testo estratto dal documento solo quando la lettura sui nostri server è incerta. Dettagli in Trattamento dati & AI.

Serve un account gratuito: con i crediti di benvenuto la prima elaborazione è offerta. Registrati in 30 secondi

Cosa fa

A differenza di un listino, un catalogo mescola testi descrittivi, schede prodotto, tabelle di varianti e immagini. Questo strumento individua le schede articolo, ne estrae i dati strutturati (codice, nome, descrizione, dimensioni, colori, materiali, prezzo dove presente) e li allinea in colonne coerenti anche quando le pagine hanno layout diversi tra loro. Le varianti di uno stesso prodotto diventano righe separate con gli attributi che le distinguono.

Per chi è

Chi gestisce un e-commerce e riceve i cataloghi dei fornitori solo in PDF, agenzie che caricano assortimenti per conto dei clienti, uffici commerciali che devono trasformare il catalogo stampa in un file lavorabile.

Come funziona

  • Carichi il catalogo PDF (fino a 15 MB).
  • Il motore individua le schede prodotto e le tabelle varianti pagina per pagina.
  • Gli attributi vengono allineati su un insieme di colonne comune a tutto il catalogo.
  • Verifichi l’anteprima e scarichi il CSV.

Input supportati

Cataloghi in PDF con testo selezionabile (generati digitalmente) fino a 15 MB e circa 80 pagine per elaborazione, sia con impaginazione tabellare sia a schede. I cataloghi scansionati (immagini) non sono ancora supportati: in quel caso l’elaborazione viene segnalata subito come non riuscita e non ti viene addebitato nulla. Un catalogo in parte digitale e in parte scansionato (una pagina fotografata, una tabella misure acquisita con lo scanner) viene invece elaborato e addebitato, perché il testo delle altre pagine c’è: in quel caso il risultato ti dice quali pagine non contenevano testo selezionabile e che il loro contenuto non è in questo risultato, invece di dichiararsi completo. Se invece la parte digitale non contiene tabelle — per esempio è generata al computer solo la copertina, e il resto è tutto scansionato — non resta niente da consegnare: il lavoro viene segnalato come non riuscito, ti diciamo quante pagine su quante erano senza testo selezionabile e non ti viene addebitato nulla. I PDF protetti da password vengono rifiutati allo stesso modo: senza la password le pagine non si aprono, l’elaborazione si ferma subito e non ti viene addebitato nulla. Apri il file con la sua password, salvane una copia senza protezione e carica quella. Le 80 pagine sono il tetto massimo, non la regola: quando le righe non stanno in una griglia netta la lettura passa dall’intelligenza artificiale, che riceve al massimo circa 280.000 caratteri di testo — quanto ottanta pagine di media. I due tetti sono tarati per mordere nello stesso punto: misurato l’8 settembre 2026 su dieci documenti italiani veri, è esattamente quanto testo portano ottanta pagine. Un catalogo a schede, con le foto, ne porta molto meno: sui tre cataloghi fornitore veri misurati il 21 settembre 2026 a fermare la lettura è sempre il tetto delle pagine, mai quello del testo. Solo su un documento molto più fitto della media quel limite arriva prima dell’ottantesima pagina. Il risultato dichiara sempre a quale pagina la lettura si è fermata, e il messaggio ti dice da quale pagina ripartire. Quando il documento prosegue oltre il taglio la parte letta ti viene consegnata lo stesso, con il taglio dichiarato: il lavoro si conclude e i crediti restano spesi, anche se i dati che cercavi stavano oltre. Puoi caricare come lavoro separato un PDF con le sole pagine che ti servono.

C’è una seconda perdita possibile, indipendente da questi due tetti: dentro le pagine lette l’estrazione assistita dall’intelligenza artificiale può smettere di elencare prima della fine, restituendo articoli giusti ma pochi. A cercarla è prima di tutto il controllo dei codici articolo, che non conta righe ma articoli: impara come sono scritti i codici che ha estratto dal tuo catalogo — per esempio 13GI0006 — e rilegge il testo del PDF cercando tutti i codici scritti in quel modo. Il riepilogo ti dice quanti ne ha trovati nel documento, quanti ne sono arrivati nel file e, se qualcuno manca, quali sono, per nome: così sai che cosa ricaricare senza riaprire il PDF. Quando non manca nessuno, il riepilogo dice anche quello. Il controllo vale per i codici di quella forma, e lo dichiara: un catalogo che ne usa una seconda viene contato sulla più diffusa. Dove quel controllo non ha niente da imparare — un catalogo che i codici articolo non li ha proprio — restano le due letture più grezze, che rispondono alla stessa domanda contando righe: la griglia che legge le tabelle riga per riga e, quando la griglia non riconosce la struttura del documento, il conteggio delle righe del testo estratto che hanno la forma di una riga di tabella. Quando una delle due si scosta dal risultato, il file lo dichiara con entrambi i conteggi e si considera incompleto. Qui una garanzia non c’è — su un documento fatto in prevalenza di prosa, con qualche tabella dentro, nessuna delle due letture sa dire quante ne dovevano tornare, e una perdita lì non te la segnala nessuno: su un documento così conta gli articoli del file contro l’originale prima di importarli. In tutti i casi in cui la perdita la dichiariamo, è nostra e non del tuo documento: il file ti arriva lo stesso e non lo paghi — il riepilogo lo dice con le parole «non te lo facciamo pagare» e i crediti ti tornano indietro da soli. Ricaricare come lavoro separato le pagine che mancano è il modo più efficace per recuperarle.

C’è infine un tetto che non riguarda il documento ma la nostra risposta: gli articoli tornano indietro in un’unica risposta del modello, e quella risposta ha uno spazio finito. Un documento che ne contiene moltissime lo esaurisce. Se lo esaurisce prima che ne arrivi una parte utilizzabile, il lavoro viene segnalato come non riuscito, il messaggio ti dice che il documento contiene più voci di quante riusciamo a restituirne in una volta sola e non ti viene addebitato nulla; se lo esaurisce dopo, il risultato ti viene consegnato con il taglio dichiarato fra le note e non lo paghi: lo spazio della nostra risposta è un limite nostro, non del tuo catalogo. In entrambi i casi il gesto è lo stesso: caricare il PDF a blocchi di poche pagine per volta.

Risultato

Un file CSV in UTF-8 con BOM, una riga per articolo o variante e le colonne effettivamente ricavabili dal catalogo. Il separatore di colonna è il punto e virgola e i numeri usano la virgola decimale, senza separatore delle migliaia: è il formato che Excel e LibreOffice in italiano aprono con le colonne già separate. Accanto trovi una seconda copia degli stessi dati, per l’import in e-commerce e gestionali: virgola come separatore, punto decimale, UTF-8 senza BOM, solo l’intestazione e le righe di dati, senza le righe «#»; se il catalogo ha più tabelle con colonne diverse, arriva come ZIP con un file CSV per tabella. Al termine dell’elaborazione la pagina riepiloga quanti articoli sono stati estratti, quante colonne sono state riconosciute e da quante pagine provengono. Quando l’estrazione viene assistita dall’AI il conteggio delle pagine con tabelle non è misurabile, e il riepilogo lo dichiara. Le righe che nel documento stanno da sole, senza una griglia accanto — il titolo, una nota, l’intestazione di una categoria come «Bibite fredde» in mezzo a un listino — non diventano una colonna: restano fuori dalle righe di dati. Il riepilogo le elenca una per una, con il testo che il documento riporta, e le ripete in fondo al file nelle righe che iniziano con «#»: così sai che cosa è rimasto fuori senza riaprire il PDF. Quando sono troppe per stare in una nota leggibile, il riepilogo dice quante ne restano fuori dall’elenco: il numero complessivo non viene mai taciuto.

Limiti

Le informazioni presenti solo nelle immagini (per esempio una tabella misure fotografata) non vengono estratte. Cataloghi con impaginazione molto libera possono produrre colonne incomplete: i campi mancanti restano vuoti e vengono conteggiati nel riepilogo, mai riempiti per deduzione. C’è un secondo caso, e la differenza sta in chi ha sbagliato: lo spazio fra le migliaia, «€ 1 559,62», lo leggiamo quando il PDF scrive l’importo tutto d’un pezzo; se invece lo stampa a pezzi separati non sappiamo distinguerlo da due colonne accostate, e piuttosto che inventare un prezzo mille volte più grande lasciamo la cella com’è scritta, come testo. Quando capita non diamo la colpa al tuo documento: il riepilogo, e le righe «#» in fondo al CSV, dichiara che a non averlo letto siamo stati noi, quanti sono e in quale colonna stanno. E se una colonna che il documento porta non viene letta in nessuna riga, il risultato non si dichiara completo: te la nominiamo, e le celle restano vuote invece di essere indovinate. Se il job fallisce, i crediti vengono rimborsati. E se il file ti arriva ma è incompleto per un limite della nostra lettura — codici articolo che non sono arrivati, colonne mai lette, frammenti rimasti fuori da ogni colonna — il file ti viene consegnato lo stesso e non lo paghi. Restano a carico tuo solo i tagli dichiarati qui sopra, quelli che dipendono da quanto è grande il documento e che conosci prima di caricarlo.

Privacy e dati

Il catalogo caricato viene conservato in un’area privata non accessibile dal web, usato solo per l’elaborazione ed eliminato automaticamente: subito dopo un’elaborazione riuscita, entro due giorni se l’elaborazione fallisce (in quel caso il file serve a capire cosa non ha funzionato). Il file CSV generato resta scaricabile solo dal tuo account per 14 giorni, poi viene eliminato. I contenuti non vengono usati per addestrare modelli.

Domande frequenti

Il CSV è pronto per WooCommerce o PrestaShop?

Il file usa intestazioni chiare e valori puliti, quindi è una buona base per gli importer di WooCommerce, PrestaShop o Shopify. Per l’import scarica la copia per software che trovi accanto al file principale: virgola come separatore, punto decimale, senza BOM e senza righe «#». È quella che serve a Shopify, che accetta solo la virgola; WooCommerce la legge con le impostazioni di partenza, e in PrestaShop basta indicare la virgola come separatore dei campi. Se il catalogo produce più tabelle con struttura diversa, la copia arriva come ZIP con un file CSV per tabella, ognuno con la sua intestazione in prima riga: si importano una alla volta. Il file principale, col punto e virgola e la virgola decimale, è quello da aprire in Excel. Il riepilogo dice quante tabelle sono state trovate. La mappatura finale delle colonne sui campi della piattaforma resta a carico tuo.

Le immagini dei prodotti vengono estratte?

No, questo strumento estrae dati testuali. Le immagini incorporate nel PDF non fanno parte dell’output CSV.

Come vengono gestite le varianti (taglie, colori)?

Ogni variante diventa una riga con il codice del prodotto e gli attributi che la distinguono, quando il catalogo li riporta in forma tabellare o testuale.

I codici che iniziano per zero (001234) restano interi?

Nel file sì, sempre: il CSV consegnato contiene 001234 con tutti i suoi zeri, e gli importer che lo leggono direttamente (gestionali, WooCommerce, PrestaShop, Shopify, pandas) lo prendono esatto. Quello che va saputo riguarda il doppio clic: se apri il CSV facendoci doppio clic, Excel e LibreOffice riconoscono 001234 come un numero e scrivono 1234, perdendo gli zeri davanti. Non è un difetto del file, è come quei programmi interpretano un CSV all’apertura — e vale per qualunque CSV, non solo per i nostri. Per conservarli hai due strade: importare il file invece di aprirlo (in Excel: Dati → Da testo/CSV, dichiarando quella colonna come Testo), oppure prendere lo stesso documento in .xlsx, dove i codici restano testo senza dover impostare niente. Al termine dell’elaborazione il riepilogo ti dice se il tuo documento contiene codici di questo tipo, in quali colonne e quanti: se non ce ne sono, lo dice anche quello.

Pago anche se il file è incompleto?

Dipende da chi ha perso gli articoli. Se il catalogo va oltre un limite scritto qui sopra — le 80 pagine, i circa 280.000 caratteri, le pagine scansionate di un PDF misto — ricevi la parte letta e la paghi: quanto leggiamo lo sai prima di caricare. Se invece qualcosa lo abbiamo perso noi dentro le pagine lette — codici articolo che il PDF porta e nel file non ci sono, la risposta del modello finita prima della fine dell’elenco, una colonna dichiarata e mai riempita, frammenti rimasti fuori dalle colonne — il file ti arriva lo stesso, il riepilogo lo dice con le parole «non te lo facciamo pagare» e i crediti ti tornano indietro. Nel registro dei crediti trovi il movimento come «File incompleto per una nostra lettura, non addebitato».

Come faccio a sapere se avete preso tutti gli articoli?

Te lo diciamo noi, con i codici del tuo catalogo. Il controllo impara come sono scritti i codici che ha estratto — per esempio 13GI0006 — e poi rilegge il testo del PDF cercando tutti i codici scritti in quel modo: il riepilogo riporta quanti ne ha trovati nel documento, quanti sono nel file e l’elenco per nome di quelli mancanti. Misurato il 21 settembre 2026 su un catalogo fornitore vero, quello che trovi qui sopra in «Esempio di risultato reale» (Siggi Group Workwear, pagine scaricate dal sito del produttore): sulle dodici pagine dell’esempio, 24 codici nel PDF e tutti e 24 nel file. Su un blocco più grosso dello stesso catalogo i codici nel PDF sono 99 e nel file ne sono arrivati 78: il riepilogo elenca i mancanti per nome, e quel lavoro non è stato addebitato. Il controllo vale per i codici di quella forma — se il catalogo ne usa una seconda, il riepilogo lo dichiara invece di spacciare il conteggio per completo — e su un catalogo che i codici non li ha proprio il controllo tace, invece di inventarne uno.