// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

Self-Distilled Reasoning: recuperare il ragionamento nel fine-tuning di Amazon Nova

Fare SFT su dataset senza reasoning trace può azzerare la capacità di ragionamento di un modello. Il Self-Distilled Reasoning riusa la catena di pensiero del modello base per preservarla, a costo di annotazione zero.

Un team AWS ha pubblicato un’analisi su un problema poco discusso del fine-tuning: fare Supervised Fine-Tuning (SFT) su dataset privi di reasoning trace può sopprimere la capacità di ragionamento del modello. La causa è che la loss viene calcolata insieme su token di reasoning e di output: se i dati contengono solo coppie input-output, il modello impara a saltare il ragionamento. Nei loro esperimenti su Amazon Nova 2 Lite, la performance su un benchmark di matematica di controllo crolla dal 70% a valori vicini allo zero.

La proposta si chiama Self-Distilled Reasoning (SDR). L’idea è riusare la chain-of-thought del modello base come surrogato per i dataset senza reasoning: si generano le trace con lo stesso Nova 2 Lite, si prepongono agli output originali e si fa SFT con la modalità reasoning attiva, fornendo supervisione sia sul ragionamento sia sulla risposta. Il costo di annotazione è nullo, non serve un teacher separato.

I risultati

Rispetto al model merging — l’approccio usato finora per recuperare le capacità perse — l’SDR mantiene la matematica intorno al 68% migliorando al contempo la target performance di oltre il 6,5% in media. L’effetto regge anche quando il modello base è debole sul dominio target: su MedMCQA, dove il base fa 55,6%, l’SDR porta la target accuracy da 63,8% a 66,6% e recupera la matematica dallo 0% al 67,9%.

Particolarmente utile il caso dei dataset con reasoning parziale. Senza SDR, scendendo sotto il 75% di copertura di reasoning la matematica collassa (66,6% → 21,7% → 3,3% → 2,5%); con l’SDR resta nell’intervallo 65-72% a qualsiasi percentuale, persino con zero trace. Un avvertimento controintuitivo: un teacher più forte non è sempre meglio. Le trace di Nova 2 Pro migliorano la target performance ma fanno calare quella generale, coerentemente con l’idea che un divario troppo ampio tra student e teacher danneggi la distillazione. La raccomandazione degli autori è usare trace della stessa famiglia (Nova 2 Lite per clienti Nova 2 Lite) come ricetta di default.

In sintesi

  • L’SFT su dataset senza reasoning trace può azzerare il ragionamento del modello (matematica dal 70% a ~0%).
  • Il Self-Distilled Reasoning riusa la chain-of-thought del modello base, mantenendo la matematica ~68% e migliorando la target performance oltre il 6,5%.
  • Meglio trace della stessa famiglia: un teacher troppo più forte peggiora la performance generale.

Fonte: Exploring self-distilled reasoning for supervised fine-tuning with Amazon Nova

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma