Un consorzio di ricerca tedesco ha pubblicato il pretraining report di Soofi S 30B-A3B, base model aperto per tedesco e inglese. Il dettaglio metodologicamente più interessante non è nei benchmark, ma in una scelta progettuale: il team ha adottato l’architettura di riferimento Nemotron 3 Nano senza alcuna modifica, per ragioni di deployability su stack come vLLM, efficienza di serving e controllo scientifico. Con il backbone congelato, l’unica variabile in movimento è la data recipe — e Nemotron 3 Nano diventa una baseline architetturalmente identica.
L’architettura
Soofi S è un modello Mixture-of-Experts ibrido Mamba-Transformer: circa 31,6B parametri totali, ~3,2B attivati per token. Lo stack conta 52 layer — 23 Mamba-2 di sequence mixing, 23 MoE granulari e 6 di Grouped-Query Attention. Solo quei 6 layer GQA mantengono una KV cache, ed è da lì che arriva gran parte del guadagno di efficienza. Ogni layer MoE ospita 128 routed expert, ne attiva 6 per token e aggiunge 2 shared expert.
La recipe di training
Il training segue uno schedule Warmup–Stable–Decay per un totale di ~26,68T token consumati in tre fasi. La fase 1 ne consuma ~20T su una miscela quality-tiered a plateau 1e-3. La fase 2 ne consuma ~6,58T di dati di annealing ad alta qualità, decadendo da 1e-3 a 1e-5 e proseguendo poi costante. La fase 3 ne consuma ~0,10T a sequence length di 1.048.576 token, estendendo la finestra di contesto utilizzabile fino a 1M.
Il tedesco è la variabile deliberata: passa dal 7,2% dei token effettivi in fase 1 al 15,32% in fase 2, contro il ~5% che la miscela Nemotron 3 Nano di riferimento alloca a tutte le lingue non inglesi messe insieme. Il run ha usato fino a 512 GPU NVIDIA B200 dal 24 marzo al 13 maggio 2026, consumando ~253.000 GPU-hour B200 sull’Industrial AI Cloud di Deutsche Telekom a Monaco.
I numeri
La valutazione mette Soofi S contro 16 altri base model aperti con la stessa pipeline lm-evaluation-harness, stessi prompt e stesse impostazioni few-shot. Aggregato inglese 70,1; aggregato tedesco 79,1; held-out 41,4 (EN) e 41,8 (DE); HumanEval pass@1 73,8; MBPP-DE 84,2; GSM8K 86,1; GPQA-Diamond 43,4; GLP-DE 88,8.
Rispetto al riferimento architetturalmente identico, il guadagno è di 1,8 punti sull’aggregato inglese, 4,2 sul tedesco e 6,7 sull’held-out inglese: è la misura isolata di cosa produce la sola data recipe. Il quadro cambia contro modelli open-weight più grandi: Qwen3.5 35B-A3B detiene le medie più alte su inglese, tedesco e held-out.
Vincoli da tenere presenti prima di pianificarci sopra qualcosa: è un base model senza instruction tuning, alignment o safety tuning; i pesi sono in gated preview su Hugging Face e la licenza non è finalizzata; restano aperti i gap su estrazione RULER a input lunghi e recall fattuale.
In sintesi
- Backbone Nemotron 3 Nano invariato: il confronto isola l’effetto della data recipe, +1,8 punti in inglese e +4,2 in tedesco sulla baseline identica.
- 3,2B parametri attivi su 31,6B totali e KV cache su soli 6 layer di 52: l’efficienza nasce dalla struttura ibrida Mamba-MoE-GQA.
- Base model senza instruction tuning, pesi in gated preview e licenza non ancora finalizzata: da valutare prima di qualsiasi pianificazione produttiva.
Fonte: Soofi Consortium Releases Soofi S 30B-A3B: An Open Hybrid Mamba-Transformer MoE Foundation Model For German And English — https://www.marktechpost.com/2026/07/15/soofi-consortium-releases-soofi-s-30b-a3b-an-open-hybrid-mamba-transformer-moe-foundation-model-for-german-and-english/
Hai qualcosa da aggiungere? Unisciti alla discussione.