#mlops
risultati
-
Real World VoiceEQ: misurare la qualità umana della voice AI
Hume AI e Hugging Face presentano Real World VoiceEQ, un benchmark che valuta oltre 40 modelli vocali su…
-
Valutare un sistema RAG in produzione: dalla golden dataset alla CI
Una guida pratica per costruire una evaluation pipeline che intercetta fallimenti di retrieval, hallucination e drift prima che…
-
LiteRT.js: Google porta i modelli .tflite nel browser con WebGPU
Google ha rilasciato LiteRT.js, il binding JavaScript del suo runtime di inference on-device. Esegue modelli .tflite direttamente nel…
-
Model routing: sembra semplice, poi diventa un problema di ottimizzazione
IBM Research racconta perché instradare le richieste tra modelli non è una semplice classificazione, ma un problema di…
-
QA agentica con Nova Act: test suite e integrazione nelle pipeline CI/CD
La seconda parte su QA Studio con Amazon Nova Act mostra come organizzare i test in suite parallele…
-
Ridurre latenza e costi di inference degli LLM in produzione: 12 leve pratiche
Scalare un’app LLM non significa aggiungere GPU, ma togliere lavoro inutile da ogni richiesta. Una rassegna di 12…
-
Multi-agent con Strands Agents e Bedrock: Swarm vs Graph a confronto
Thrad.ai ha costruito un sistema multi-agente per la social intelligence con Strands Agents e Amazon Bedrock AgentCore. Il…
-
Prime Intellect rilascia Verifiers v1: taskset, harness e runtime componibili per l’RL agentico
Verifiers v1 scompone gli ambienti di reinforcement learning agentico in tre pezzi disaccoppiati, cosi’ che qualsiasi taskset possa…
-
Deployare modelli quantizzati con Unsloth su SageMaker: quattro pattern
Quattro pattern per servire su AWS modelli quantizzati con Unsloth, tra GGUF su EC2/SageMaker e merged weights su…