#gpu
risultati
-
I data center verso un quinto dell’elettricità USA entro il 2035, secondo BloombergNEF
Un report di BloombergNEF stima che i data center useranno un quinto dell’elettricità generata negli USA entro il…
-
srt-slurm: il framework NVIDIA per benchmark riproducibili di LLM serving su SLURM
srt-slurm di NVIDIA trasforma configurazioni YAML dichiarative in workflow di benchmark SLURM riproducibili per il serving distribuito di…
-
Quali LLM locali girano davvero su una singola GPU da 24GB nel 2026
Quali LLM locali stanno davvero su una singola GPU da 24GB nel 2026 e come si spende la…
-
Fine-tuning LLM: come si dividono Unsloth, Axolotl, TRL e LLaMA-Factory
Unsloth, Axolotl, TRL e LLaMA-Factory avvolgono lo stesso stack ma spendono l’effort in modo diverso: un confronto su…
-
Quanto di un workflow di data science gira su GPU oggi? La data preparation con cuDF e Polars
GPU acceleration non è più solo deep learning: con cuDF, cudf.pandas e il Polars GPU Engine molti workflow…
-
Fine-tuning di Qwen3 con LoRA usando NVIDIA NeMo AutoModel su una singola GPU
Un workflow completo su Google Colab per il fine-tuning parameter-efficient di Qwen3-0.6B con LoRA tramite NeMo AutoModel, dallo…
-
LiteRT.js: Google porta i modelli .tflite nel browser con WebGPU
Google ha rilasciato LiteRT.js, il binding JavaScript del suo runtime di inference on-device. Esegue modelli .tflite direttamente nel…
-
Quanto costa davvero far girare un LLM in locale? Euro per milione di token, misurati
Un benchmark misura il costo in energia GPU di otto modelli locali su una singola RTX 3090. Il…
-
Programmazione GPU a tile con NVIDIA: da cuTile e Triton alla flash attention
Un modello di programmazione GPU che ragiona per tile invece che per singolo thread: con TileGym, cuTile e…
-
Il collo di bottiglia dell’AI non è il compute, è spostare i dati
Sara A. Metwalli argomenta che i sistemi AI moderni non sono limitati dalla velocità di calcolo ma dalla…