#llm
risultati
-
Fine-tuning di Qwen3 con LoRA usando NVIDIA NeMo AutoModel su una singola GPU
Un workflow completo su Google Colab per il fine-tuning parameter-efficient di Qwen3-0.6B con LoRA tramite NeMo AutoModel, dallo…
-
Costruire un’architettura RAG: perché conviene un repository intermedio
Come combinare i dati aziendali con un foundation model tramite RAG, e perché far atterrare i dati in…
-
Google Cloud: un memory agent che sostituisce RAG con la consolidation continua
Google Cloud pubblica come open source un memory agent che scrive memoria strutturata in SQLite senza vector DB…
-
KDnuggets Weekly Roundup: cosa leggere dalla settimana del 13 luglio 2026
La rassegna settimanale di KDnuggets mette insieme registry pattern in Python, riduzione di latenza e costi degli LLM,…
-
Kimi K3, DeepSeek V4 Pro e GLM-5.2: tre MoE open a confronto tra benchmark e costi
Confronto tra Kimi K3, DeepSeek V4 Pro e GLM-5.2: capacità, licenze e costi di serving dei tre MoE…
-
FivetranChat: costruire un chatbot RAG interno con strumenti off-the-shelf
Come Fivetran ha messo in produzione un chatbot interno basato su architettura RAG, appoggiandosi ai servizi AI nativi…
-
Memoria sempre attiva: l’agente di Google Cloud che prova a superare il RAG
Google Cloud rilascia un memory agent open source che sostituisce embedding e vector DB con consolidamento LLM continuo…
-
Una sola pipeline RAG, quattro PDF diversissimi: gli stessi quattro bricks, ogni risposta tipizzata e citata
Una singola funzione pdf_qa collega i quattro bricks di una pipeline RAG e gira senza modifiche su un…
-
Un evidenziatore di cliche per riconoscere il testo scritto dagli LLM
Simon Willison, stanco di articoli pieni dei cliche tipici della scrittura generata dagli LLM, ha fatto vibe-codare un…
-
Governare Muse Spark 1.1 e qualsiasi LLM esterno con Unity AI Gateway
Databricks introduce i Model Provider Services nella Unity AI Gateway: registri un provider come Muse Spark 1.1 una…