#attention
risultati
-
Moonshot AI rilascia Kimi K3: un MoE open da 2,8 trilioni di parametri con contesto da 1M
Kimi K3 è un Mixture-of-Experts open da 2,8T di parametri con Kimi Delta Attention e finestra di contesto…
-
Programmazione GPU a tile con NVIDIA: da cuTile e Triton alla flash attention
Un modello di programmazione GPU che ragiona per tile invece che per singolo thread: con TileGym, cuTile e…
-
Profiling dell’attention in PyTorch: cosa rivelano davvero i backend di SDPA
Terza parte della serie di Hugging Face sul profiling in PyTorch: dall’attention scritta a mano ai backend di…
-
Attenzione sparsa: il paper che potrebbe dimezzare i costi di inferenza
Un nuovo meccanismo di attenzione riduce la complessità quadratica a quasi-lineare senza perdere qualità. Spieghiamo come funziona.