Paper
Ricerca e letteratura, spiegata
risultati
-
Self-Distilled Reasoning: recuperare il ragionamento nel fine-tuning di Amazon Nova
Fare SFT su dataset senza reasoning trace può azzerare la capacità di ragionamento di un modello. Il Self-Distilled…
-
Gli LLM non ereditano solo i bias: nel recruiting ne inventano di nuovi
Uno studio di Princeton e Chicago (ICML) mostra che gli LLM sviluppano bias propri dall’esperienza e nel recruiting…
-
Tabular foundation model: un modello da 28M di parametri batte XGBoost tunato
Sul benchmark TabArena ogni singolo modello sopra il miglior gradient-boosted tree tunato è un tabular foundation model. Una…
-
SQRL: modelli text-to-SQL che ispezionano il database prima di scrivere la query
SQRL di Feyn AI ispeziona il database in sola lettura prima di impegnare la query: 70,6% di execution…
-
OpenAI presenta GPT-Red: il modello di red-teaming automatico che batte gli umani sulla prompt injection
GPT-Red è un modello interno di OpenAI addestrato in self-play a scovare vulnerabilità di prompt injection: su un’arena…
-
Moonshot AI rilascia Kimi K3: un MoE open da 2,8 trilioni di parametri con contesto da 1M
Kimi K3 è un Mixture-of-Experts open da 2,8T di parametri con Kimi Delta Attention e finestra di contesto…
-
GPT-Red: come OpenAI usa il self-play per irrobustire i modelli contro la prompt injection
OpenAI descrive GPT-Red, il suo red-teamer automatizzato addestrato con reinforcement learning in self-play: usato nell’addestramento di GPT-5.6, ha…
-
Thinking Machines Lab rilascia Inkling, MoE multimodale da 975B a pesi aperti
Inkling è un Mixture-of-Experts da 975B parametri totali (41B attivi) con contesto fino a 1M token, input testo-immagini-audio…
-
Real World VoiceEQ: misurare la qualità umana della voice AI
Hume AI e Hugging Face presentano Real World VoiceEQ, un benchmark che valuta oltre 40 modelli vocali su…