Un team AWS ha pubblicato un’analisi su un problema poco discusso del fine-tuning: fare Supervised Fine-Tuning (SFT) su dataset privi di reasoning trace può sopprimere la capacità di ragionamento del modello. La causa è che la loss viene calcolata insieme su token di reasoning e di output: se i dati contengono solo coppie input-output, il modello impara a saltare il ragionamento. Nei loro esperimenti su Amazon Nova 2 Lite, la performance su un benchmark di matematica di controllo crolla dal 70% a valori vicini allo zero.
La proposta si chiama Self-Distilled Reasoning (SDR). L’idea è riusare la chain-of-thought del modello base come surrogato per i dataset senza reasoning: si generano le trace con lo stesso Nova 2 Lite, si prepongono agli output originali e si fa SFT con la modalità reasoning attiva, fornendo supervisione sia sul ragionamento sia sulla risposta. Il costo di annotazione è nullo, non serve un teacher separato.
I risultati
Rispetto al model merging — l’approccio usato finora per recuperare le capacità perse — l’SDR mantiene la matematica intorno al 68% migliorando al contempo la target performance di oltre il 6,5% in media. L’effetto regge anche quando il modello base è debole sul dominio target: su MedMCQA, dove il base fa 55,6%, l’SDR porta la target accuracy da 63,8% a 66,6% e recupera la matematica dallo 0% al 67,9%.
Particolarmente utile il caso dei dataset con reasoning parziale. Senza SDR, scendendo sotto il 75% di copertura di reasoning la matematica collassa (66,6% → 21,7% → 3,3% → 2,5%); con l’SDR resta nell’intervallo 65-72% a qualsiasi percentuale, persino con zero trace. Un avvertimento controintuitivo: un teacher più forte non è sempre meglio. Le trace di Nova 2 Pro migliorano la target performance ma fanno calare quella generale, coerentemente con l’idea che un divario troppo ampio tra student e teacher danneggi la distillazione. La raccomandazione degli autori è usare trace della stessa famiglia (Nova 2 Lite per clienti Nova 2 Lite) come ricetta di default.
In sintesi
- L’SFT su dataset senza reasoning trace può azzerare il ragionamento del modello (matematica dal 70% a ~0%).
- Il Self-Distilled Reasoning riusa la chain-of-thought del modello base, mantenendo la matematica ~68% e migliorando la target performance oltre il 6,5%.
- Meglio trace della stessa famiglia: un teacher troppo più forte peggiora la performance generale.
Fonte: Exploring self-distilled reasoning for supervised fine-tuning with Amazon Nova
Hai qualcosa da aggiungere? Unisciti alla discussione.