#llm
risultati
-
Kimi K3: il modello open-weights che accorcia la distanza dalla frontiera
Con Kimi K3, modello open-weights da 2,8T parametri vicino alla frontiera, Nathan Lambert legge un ecosistema in cui…
-
MiniCPM5-1B fine-tuned su tracce Claude Fable 5: un thinking model locale da 657MB
Uno sviluppatore ha pubblicato un modello da 1B, con build GGUF a partire da ~657MB, che gira interamente…
-
Tabular foundation model: un modello da 28M di parametri batte XGBoost tunato
Sul benchmark TabArena ogni singolo modello sopra il miglior gradient-boosted tree tunato è un tabular foundation model. Una…
-
LLM cascade per la generazione RAG: partire dal modello piccolo, escalare solo se serve
Un benchmark su venti modelli locali contro un flagship hosted mostra che la dimensione non predice l’accuracy e…
-
Non hai ricevuto il modello AI che hai pagato: il routing rompe l’identità del modello
Il routing a livello di richiesta ha reso il model ID un identificatore legale, ma nessuno ha deciso…
-
Perché aggiungere più agenti AI ha reso il nostro sistema più lento
Scalando gli agenti LLM la latency saliva e arrivavano i timeout. La colpa non era di OpenAI: era…
-
RAG: la maggior parte delle “allucinazioni” sono errori di extraction
Nel RAG il modello legge il contesto: se la risposta è sbagliata è quasi sempre un errore di…
-
Quali LLM locali girano davvero su una singola GPU da 24GB nel 2026
Quali LLM locali stanno davvero su una singola GPU da 24GB nel 2026 e come si spende la…
-
SQRL: modelli text-to-SQL che ispezionano il database prima di scrivere la query
SQRL di Feyn AI ispeziona il database in sola lettura prima di impegnare la query: 70,6% di execution…
-
RAG: quando conviene passare i candidati al modello uno alla volta
Passare i candidati al modello uno alla volta, con un segnale di sufficienza a due booleani, taglia i…