#efficienza
risultati
-
Gigatoken: un tokenizer BPE in Rust che arriva a 24,53 GB/s
Gigatoken, tokenizer BPE in Rust sotto licenza MIT, arriva a 24,53 GB/s su GPT-2: 989x i tokenizers HuggingFace.…
-
Google spinge la serie Gemini Flash su efficienza e prezzo: 3.6 Flash, 3.5 Flash-Lite e Flash Cyber
Google aggiorna il tier Flash di Gemini puntando su token efficiency e costi più bassi. La 3.6 Flash…
-
Perché aggiungere più agenti AI ha reso il nostro sistema più lento
Scalando gli agenti LLM la latency saliva e arrivavano i timeout. La colpa non era di OpenAI: era…
-
Huge pages in ClickHouse Managed Postgres: come tenere piatte le page table
ClickHouse spiega come configura le huge pages nel suo Managed Postgres per evitare che shared_buffers diventi una tassa…
-
Usare uvx in GitHub Actions senza bombardare PyPI a ogni run
Un piccolo trucco di Simon Willison per eseguire tool Python con uvx nelle GitHub Actions sfruttando la cache,…
-
Context rot: perché le sessioni lunghe di Claude Code degradano
Le sessioni degradano molto prima del limite di token. Jake Minns distingue intrinsic rot e content rot e…
-
dbt e il report IDC: 58,7 FTE recuperati, ma leggiamo bene il campione
dbt Labs rilancia un report IDC commissionato che quantifica in FTE il tempo recuperato dai data team. Numeri…
-
Writable warm storage in OpenSearch Service: scrivere sul tier caldo senza migrazioni
Amazon OpenSearch Service aggiunge un tier warm scrivibile su istanze OI2 e S3: niente più round trip warm-hot-warm…
-
Il long context ha un costo: un layer di prompt-pruning deterministico per sistemi LLM
Nelle conversazioni LLM lunghe il prompt cresce all’infinito, accumulando token ridondanti che aumentano costo e latenza. Un pipeline…