#inferenza
risultati
-
Deployare modelli quantizzati con Unsloth su SageMaker: quattro pattern
Quattro pattern per servire su AWS modelli quantizzati con Unsloth, tra GGUF su EC2/SageMaker e merged weights su…
-
Ollama e la corsa a far girare modelli open in locale
Ollama rende semplice eseguire modelli open-weight sul proprio PC. Con quasi 8,9 milioni di sviluppatori al mese e…
-
SageMaker AI: una UI per le inference recommendations della GenAI
Amazon SageMaker AI porta in Studio un’interfaccia low-code per ottenere configurazioni di inference ottimizzate per i modelli generativi,…
-
LingBot-VA 2.0: il modello video-action di Robbyant pensato nativamente per la Physical AI
Robbyant (Ant Group) pre-addestra da zero un DiT causale video-action per la manipolazione robotica generalista, invece di adattare…
-
Il collo di bottiglia dell’AI non è il compute, è spostare i dati
Sara A. Metwalli argomenta che i sistemi AI moderni non sono limitati dalla velocità di calcolo ma dalla…
-
RAG era sempre stato un workaround temporaneo. Cosa viene dopo
Un’analisi provocatoria: il RAG è un layer di traduzione ad alta latenza, non un vero sistema di memoria.…
-
Il backend transformers di vLLM raggiunge la velocità delle implementazioni native
Hugging Face ha ottimizzato il modeling backend transformers di vLLM: su tre modelli Qwen3 il throughput eguaglia o…
-
Disaggregated prefill e decode per l’inference LLM su SageMaker HyperPod
Il DPD dell’HyperPod Inference Operator separa prefill e decode su pool di GPU distinti collegati via EFA RDMA,…
-
Come Henry Schein One verifica le radiografie dentali in tempo reale con SageMaker AI
Il caso Image Verify: un sistema di quality assessment su Amazon SageMaker AI che valuta la qualità delle…
-
SageMaker HyperPod: cinque nuove funzionalità per l’inference enterprise
Amazon aggiunge a SageMaker HyperPod inference il data capture multi-tier, il deploy diretto da Hugging Face Hub, il…