// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

Soofi S 30B-A3B: un foundation model open Mamba-Transformer MoE per tedesco e inglese

Un consorzio di ricerca tedesco rilascia Soofi S 30B-A3B, un base model ibrido Mamba-Transformer MoE che attiva 3,2B di 31,6B parametri, addestrato interamente in Germania e con i punteggi aggregati più alti tra i base model completamente open testati.

Un consorzio di ricerca tedesco ha pubblicato il pretraining report di Soofi S 30B-A3B, un base model open per tedesco e inglese addestrato end-to-end sull’Industrial AI Cloud di Deutsche Telekom a Monaco. I pesi preview sono su Hugging Face. È rilevante non solo per il risultato tecnico ma anche per il tema della sovranità AI: tra i base model completamente open testati, Soofi S registra i punteggi aggregati più alti sia in inglese sia in tedesco. Il consorzio, coordinato da KI Bundesverband e finanziato dal Ministero federale tedesco, include Fraunhofer IAIS, DFKI, TU Darmstadt, ellamind e Merantix Momentum.

Architettura ibrida ed efficiente

Soofi S è un Mixture-of-Experts ibrido Mamba-Transformer da circa 31,6B parametri totali che ne attiva circa 3,2B per token. Come base model non ha instruction tuning, alignment né safety tuning. Lo stack ha 52 layer: 23 layer Mamba-2 di sequence-mixing, 23 layer MoE granulari e 6 layer Grouped-Query Attention; solo questi 6 layer GQA mantengono una KV cache, il che spiega gran parte dell’efficienza. Ogni layer MoE ha 128 experts routed, ne attiva 6 per token e aggiunge 2 shared experts. Il team adotta senza modifiche il reference design Nemotron 3 Nano, in modo da avere una baseline architetturalmente identica: così l’unica variabile è la data recipe, deployabile su stack come vLLM.

La ricetta di training

Il training segue uno schedule Warmup–Stable–Decay e ha consumato circa 26,68 trilioni di token in tre fasi: ~20T nella Fase 1 su un mix quality-tiered, ~6,58T nella Fase 2 di annealing ad alta qualità, e ~0,10T nella Fase 3 a lunghezza di sequenza oltre 1M di token per estendere il contesto. Il tedesco è la variabile deliberata: sale dal 7,2% dei token effettivi in Fase 1 al 15,32% in Fase 2, contro il ~5% che Nemotron 3 Nano alloca a tutte le lingue non inglesi combinate. La run ha usato fino a 512 GPU NVIDIA B200 dal 24 marzo al 13 maggio 2026, per circa 253.000 GPU-hours B200.

Performance e collocazione

Valutato con lm-evaluation-harness contro 16 altri base model open, Soofi S guida i modelli completamente open con 70,1 di aggregato inglese e 79,1 di aggregato tedesco. Contro il reference architetturalmente identico guadagna 1,8 punti in inglese, 4,2 in tedesco e 6,7 sull’held-out inglese, isolando l’effetto della data recipe. Su modelli open-weight più grandi il quadro cambia: Qwen3.5 35B-A3B tiene le medie più alte. Punteggi notevoli includono HumanEval 73,8, MBPP-DE 84,2, GSM8K 86,1 e GLP-DE 88,8. I casi d’uso suggeriti: document work in tedesco, assistenza al codice bilingue e serving long-context ad alta concorrenza, con gap noti su estrazione RULER a input lunghi e recall fattuale, oltre a pesi in preview gated e licenza non ancora finalizzata.

  • Attiva 3,2B di 31,6B parametri e mantiene la KV cache solo su 6 dei 52 layer, puntando su efficienza di serving.
  • La spinta sul tedesco (15,32% del mix in Fase 2) è la leva principale dei guadagni rispetto alla baseline Nemotron.
  • Backbone fisso e data recipe come unica variabile rendono il confronto un esperimento controllato sulla qualità dei dati.

Fonte: Soofi Consortium Releases Soofi S 30B-A3B: An Open Hybrid Mamba-Transformer MoE Foundation Model For German And English — https://www.marktechpost.com/2026/07/15/soofi-consortium-releases-soofi-s-30b-a3b-an-open-hybrid-mamba-transformer-moe-foundation-model-for-german-and-english/

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma