Uno sviluppatore della community, GnLOLot, ha pubblicato un modello da 1 miliardo di parametri che gira interamente in locale, con build GGUF per runtime compatibili con llama.cpp. Non richiede API key e non fa chiamate cloud. È costruito su openbmb/MiniCPM5-1B, un modello denso da 1,08B parametri con architettura LlamaForCausalLM, 24 layer, grouped-query attention e contesto da 131.072 token.
Come è fatto davvero
La scheda del modello dichiara un ulteriore fine-tuning “su dati Fable 5” per migliorare coding e instruction following, mantenendo il template di thinking nativo del base (modalità Think e No Think via enable_thinking). Qui l’articolo è netto su un punto di correttezza tecnica: non si tratta di distillation classica. La distillation trasferisce segnale dai logits o dai pesi di un modello teacher, ma nessuno ha accesso a pesi o logits di Claude. Quello che è stato fatto è supervised fine-tuning sugli output generati: si raccolgono molte conversazioni con il teacher, se ne catturano risposte e tracce di ragionamento come testo, e su quelle si addestra il base più piccolo.
La conseguenza pratica è che il modello da 1B impara a imitare formato e stile della risposta, non ad assorbire la capacità sottostante del teacher. Un budget da 1B parametri non può contenere il ragionamento di un modello frontier.
Le specifiche
Il contesto è di 128K token, ereditato dal config.json del base. Il repository GGUF offre quattro quantizzazioni: Q4_K_M è circa 657MB (la più piccola), Q5_K_M circa 751MB, Q8_0 circa 1,1GB (il default consigliato dal maintainer) e F16 circa 2,1GB. Attenzione quindi al claim “657MB”: è la quantizzazione più piccola, non la build di default. Il modello si carica in llama.cpp, Ollama, LM Studio, jan e KoboldCpp; per la modalità Think il sampling consigliato è temperature=0.9, top_p=0.95.
I punti aperti
Due caveat onesti chiudono il quadro. Primo: non sono pubblicati né benchmark né dataset di training, quindi le affermazioni sulle capacità restano al momento non verificabili. Secondo: la licenza Apache-2.0 copre solo i pesi del base, mentre l’addestramento su output di Claude solleva una questione di licensing che la scheda lascia aperta.
In sintesi
- È un supervised fine-tuning di MiniCPM5-1B su tracce Claude Fable 5, non una distillation a livello di pesi.
- Specifiche reali: contesto 128K, quant GGUF da ~657MB (Q4_K_M) a ~2,1GB (F16), con Q8_0 come default consigliato.
- Nessun benchmark o dataset pubblicato e una licenza che copre solo il base: le capacità restano non verificabili.
Fonte: Someone Fine-Tuned OpenBMB’s MiniCPM5-1B on Claude Fable 5 Traces to Ship a 657MB Local Thinking Model — https://www.marktechpost.com/2026/07/19/someone-fine-tuned-openbmbs-minicpm5-1b-on-claude-fable-5-traces-to-ship-a-657mb-local-thinking-model/
Hai qualcosa da aggiungere? Unisciti alla discussione.