// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

Soofi S 30B-A3B: cosa succede quando cambi solo i dati e lasci l’architettura invariata

Un consorzio tedesco pubblica il pretraining report di Soofi S 30B-A3B, base model ibrido Mamba-Transformer MoE. Adottando l’architettura Nemotron 3 Nano senza modifiche, isola l’effetto della sola data recipe.

Un consorzio di ricerca tedesco ha pubblicato il pretraining report di Soofi S 30B-A3B, base model aperto per tedesco e inglese. Il dettaglio metodologicamente più interessante non è nei benchmark, ma in una scelta progettuale: il team ha adottato l’architettura di riferimento Nemotron 3 Nano senza alcuna modifica, per ragioni di deployability su stack come vLLM, efficienza di serving e controllo scientifico. Con il backbone congelato, l’unica variabile in movimento è la data recipe — e Nemotron 3 Nano diventa una baseline architetturalmente identica.

L’architettura

Soofi S è un modello Mixture-of-Experts ibrido Mamba-Transformer: circa 31,6B parametri totali, ~3,2B attivati per token. Lo stack conta 52 layer — 23 Mamba-2 di sequence mixing, 23 MoE granulari e 6 di Grouped-Query Attention. Solo quei 6 layer GQA mantengono una KV cache, ed è da lì che arriva gran parte del guadagno di efficienza. Ogni layer MoE ospita 128 routed expert, ne attiva 6 per token e aggiunge 2 shared expert.

La recipe di training

Il training segue uno schedule Warmup–Stable–Decay per un totale di ~26,68T token consumati in tre fasi. La fase 1 ne consuma ~20T su una miscela quality-tiered a plateau 1e-3. La fase 2 ne consuma ~6,58T di dati di annealing ad alta qualità, decadendo da 1e-3 a 1e-5 e proseguendo poi costante. La fase 3 ne consuma ~0,10T a sequence length di 1.048.576 token, estendendo la finestra di contesto utilizzabile fino a 1M.

Il tedesco è la variabile deliberata: passa dal 7,2% dei token effettivi in fase 1 al 15,32% in fase 2, contro il ~5% che la miscela Nemotron 3 Nano di riferimento alloca a tutte le lingue non inglesi messe insieme. Il run ha usato fino a 512 GPU NVIDIA B200 dal 24 marzo al 13 maggio 2026, consumando ~253.000 GPU-hour B200 sull’Industrial AI Cloud di Deutsche Telekom a Monaco.

I numeri

La valutazione mette Soofi S contro 16 altri base model aperti con la stessa pipeline lm-evaluation-harness, stessi prompt e stesse impostazioni few-shot. Aggregato inglese 70,1; aggregato tedesco 79,1; held-out 41,4 (EN) e 41,8 (DE); HumanEval pass@1 73,8; MBPP-DE 84,2; GSM8K 86,1; GPQA-Diamond 43,4; GLP-DE 88,8.

Rispetto al riferimento architetturalmente identico, il guadagno è di 1,8 punti sull’aggregato inglese, 4,2 sul tedesco e 6,7 sull’held-out inglese: è la misura isolata di cosa produce la sola data recipe. Il quadro cambia contro modelli open-weight più grandi: Qwen3.5 35B-A3B detiene le medie più alte su inglese, tedesco e held-out.

Vincoli da tenere presenti prima di pianificarci sopra qualcosa: è un base model senza instruction tuning, alignment o safety tuning; i pesi sono in gated preview su Hugging Face e la licenza non è finalizzata; restano aperti i gap su estrazione RULER a input lunghi e recall fattuale.

In sintesi

  • Backbone Nemotron 3 Nano invariato: il confronto isola l’effetto della data recipe, +1,8 punti in inglese e +4,2 in tedesco sulla baseline identica.
  • 3,2B parametri attivi su 31,6B totali e KV cache su soli 6 layer di 52: l’efficienza nasce dalla struttura ibrida Mamba-MoE-GQA.
  • Base model senza instruction tuning, pesi in gated preview e licenza non ancora finalizzata: da valutare prima di qualsiasi pianificazione produttiva.

Fonte: Soofi Consortium Releases Soofi S 30B-A3B: An Open Hybrid Mamba-Transformer MoE Foundation Model For German And English — https://www.marktechpost.com/2026/07/15/soofi-consortium-releases-soofi-s-30b-a3b-an-open-hybrid-mamba-transformer-moe-foundation-model-for-german-and-english/

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma