// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

MiniCPM5-1B fine-tuned su tracce Claude Fable 5: un thinking model locale da 657MB

Uno sviluppatore ha pubblicato un modello da 1B, con build GGUF a partire da ~657MB, che gira interamente in locale. Non è distillation classica, ma SFT sulle tracce.

Uno sviluppatore della community, GnLOLot, ha pubblicato un modello da 1 miliardo di parametri che gira interamente in locale, con build GGUF per runtime compatibili con llama.cpp. Non richiede API key e non fa chiamate cloud. È costruito su openbmb/MiniCPM5-1B, un modello denso da 1,08B parametri con architettura LlamaForCausalLM, 24 layer, grouped-query attention e contesto da 131.072 token.

Come è fatto davvero

La scheda del modello dichiara un ulteriore fine-tuning “su dati Fable 5” per migliorare coding e instruction following, mantenendo il template di thinking nativo del base (modalità Think e No Think via enable_thinking). Qui l’articolo è netto su un punto di correttezza tecnica: non si tratta di distillation classica. La distillation trasferisce segnale dai logits o dai pesi di un modello teacher, ma nessuno ha accesso a pesi o logits di Claude. Quello che è stato fatto è supervised fine-tuning sugli output generati: si raccolgono molte conversazioni con il teacher, se ne catturano risposte e tracce di ragionamento come testo, e su quelle si addestra il base più piccolo.

La conseguenza pratica è che il modello da 1B impara a imitare formato e stile della risposta, non ad assorbire la capacità sottostante del teacher. Un budget da 1B parametri non può contenere il ragionamento di un modello frontier.

Le specifiche

Il contesto è di 128K token, ereditato dal config.json del base. Il repository GGUF offre quattro quantizzazioni: Q4_K_M è circa 657MB (la più piccola), Q5_K_M circa 751MB, Q8_0 circa 1,1GB (il default consigliato dal maintainer) e F16 circa 2,1GB. Attenzione quindi al claim “657MB”: è la quantizzazione più piccola, non la build di default. Il modello si carica in llama.cpp, Ollama, LM Studio, jan e KoboldCpp; per la modalità Think il sampling consigliato è temperature=0.9, top_p=0.95.

I punti aperti

Due caveat onesti chiudono il quadro. Primo: non sono pubblicati né benchmark né dataset di training, quindi le affermazioni sulle capacità restano al momento non verificabili. Secondo: la licenza Apache-2.0 copre solo i pesi del base, mentre l’addestramento su output di Claude solleva una questione di licensing che la scheda lascia aperta.

In sintesi

  • È un supervised fine-tuning di MiniCPM5-1B su tracce Claude Fable 5, non una distillation a livello di pesi.
  • Specifiche reali: contesto 128K, quant GGUF da ~657MB (Q4_K_M) a ~2,1GB (F16), con Q8_0 come default consigliato.
  • Nessun benchmark o dataset pubblicato e una licenza che copre solo il base: le capacità restano non verificabili.

Fonte: Someone Fine-Tuned OpenBMB’s MiniCPM5-1B on Claude Fable 5 Traces to Ship a 657MB Local Thinking Model — https://www.marktechpost.com/2026/07/19/someone-fine-tuned-openbmbs-minicpm5-1b-on-claude-fable-5-traces-to-ship-a-657mb-local-thinking-model/

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma