#inferenza
risultati
-
Quanto costa davvero far girare un LLM in locale? Euro per milione di token, misurati
Un benchmark misura il costo in energia GPU di otto modelli locali su una singola RTX 3090. Il…
-
Deployare modelli quantizzati con Unsloth su SageMaker: quattro pattern
Quattro pattern per servire su AWS modelli quantizzati con Unsloth, tra GGUF su EC2/SageMaker e merged weights su…
-
Ollama e la corsa a far girare modelli open in locale
Ollama rende semplice eseguire modelli open-weight sul proprio PC. Con quasi 8,9 milioni di sviluppatori al mese e…
-
SageMaker AI: una UI per le inference recommendations della GenAI
Amazon SageMaker AI porta in Studio un’interfaccia low-code per ottenere configurazioni di inference ottimizzate per i modelli generativi,…
-
LingBot-VA 2.0: il modello video-action di Robbyant pensato nativamente per la Physical AI
Robbyant (Ant Group) pre-addestra da zero un DiT causale video-action per la manipolazione robotica generalista, invece di adattare…
-
Il collo di bottiglia dell’AI non è il compute, è spostare i dati
Sara A. Metwalli argomenta che i sistemi AI moderni non sono limitati dalla velocità di calcolo ma dalla…
-
RAG era sempre stato un workaround temporaneo. Cosa viene dopo
Un’analisi provocatoria: il RAG è un layer di traduzione ad alta latenza, non un vero sistema di memoria.…
-
Il backend transformers di vLLM raggiunge la velocità delle implementazioni native
Hugging Face ha ottimizzato il modeling backend transformers di vLLM: su tre modelli Qwen3 il throughput eguaglia o…
-
Disaggregated prefill e decode per l’inference LLM su SageMaker HyperPod
Il DPD dell’HyperPod Inference Operator separa prefill e decode su pool di GPU distinti collegati via EFA RDMA,…
-
Come Henry Schein One verifica le radiografie dentali in tempo reale con SageMaker AI
Il caso Image Verify: un sistema di quality assessment su Amazon SageMaker AI che valuta la qualità delle…