Datalab ha rilasciato Marker 2, riscrittura completa della sua pipeline open source di conversione documentale. Marker trasforma PDF, immagini, PPTX, DOCX, XLSX, HTML ed EPUB in markdown, JSON, HTML o chunk. La nuova versione è costruita attorno a tre componenti: Surya OCR 2, un modello di layout “fast” da 20M di parametri e un pdftext riscritto, 3× più veloce del precedente.
Il risultato principale arriva da olmOCR-bench, benchmark terzo di Allen AI: la modalità balanced segna 76,0% complessivo e 83,5% sui PDF born-digital, sostenendo 2,9 pagine al secondo su una singola GPU B200. Per confronto, il backend pipeline di MinerU segna 72,7% a 0,54 pagine/s e Docling 50,3% a 2,1 pagine/s. Su MinerU il distacco non è tanto nella qualità quanto nel throughput: 5,4× più veloce a parità o vantaggio di punteggio.
Tre modalità, un compromesso diverso
Marker 2 espone tre percorsi invece di uno: balanced (76,0%, migliore su GPU), fast (66,6%, molto più economico) e --disable_ocr (43,6%, 23,7 pagine/s, interamente su CPU). La modalità è ora device-aware di default: balanced su GPU, fast su CPU/MPS. La chiave del throughput è architetturale: molti worker CPU leggeri condividono un unico server di inferenza Surya, così la capacità scala con il server invece che con la VRAM per processo. Attenzione ai breaking change prima di aggiornare: serve Python 3.10+, il packaging passa da Poetry a uv e il convertitore di structured-extraction è stato rimosso.
La licenza è il vero discrimine
Per i team commerciali il punto decisivo è la licenza. Il codice di Marker è Apache 2.0, ma i pesi dei modelli usano una licenza AI Pubs OpenRAIL-M modificata: liberi per ricerca, uso personale e startup sotto i 5M di dollari di funding o fatturato; oltre quella soglia l’uso commerciale dei pesi richiede una licenza a pagamento. Docling, di contro, è MIT, mentre MinerU resta libero fino a 20M di dollari di fatturato mensile. Un’ultima avvertenza dagli stessi autori: i numeri riflettono un solo mix documentale su un unico hardware, quindi conviene far girare l’harness — riproducibile e già dotato dei runner dei concorrenti — sul proprio corpus.
In sintesi
- Balanced: 76,0% su olmOCR-bench a 2,9 pagine/s, oltre 5× il throughput del backend pipeline di MinerU.
- Batte Docling su entrambi gli assi (76,0% vs 50,3%, 2,9 vs 2,1 pagine/s); modalità
--disable_ocrgira solo su CPU. - Codice Apache 2.0, ma i pesi richiedono licenza a pagamento sopra i 5M di dollari di funding o fatturato.
Fonte: Datalab Marker v2 vs MinerU, Docling, and Liteparse: Benchmark Breakdown — https://www.marktechpost.com/2026/07/24/datalab-marker-v2-vs-mineru-docling-and-liteparse-benchmark-breakdown/
Hai qualcosa da aggiungere? Unisciti alla discussione.