#prompt injection
risultati
-
Anthropic: Opus 5 è “il modello meno vulnerabile al prompt injection” finora
Boris Cherny di Anthropic indica nella resistenza al prompt injection il risultato più interessante di Claude Opus 5:…
-
Il permesso non è lo scopo: l’autorizzazione basata sull’intento in Omnigent
L’autorizzazione per identità è cieca allo scopo. Vincolare la sessione di un agente a un intento dichiarato blocca…
-
OpenAI presenta GPT-Red: il modello di red-teaming automatico che batte gli umani sulla prompt injection
GPT-Red è un modello interno di OpenAI addestrato in self-play a scovare vulnerabilità di prompt injection: su un’arena…
-
GPT-Red: come OpenAI usa il self-play per irrobustire i modelli contro la prompt injection
OpenAI descrive GPT-Red, il suo red-teamer automatizzato addestrato con reinforcement learning in self-play: usato nell’addestramento di GPT-5.6, ha…
-
La falla nel web_fetch di Claude: come una honeypot aggirava le difese anti-exfiltration
Ayush Paul ha trovato una scappatoia nel tool web_fetch di Claude: un sito honeypot che, tramite link annidati…
-
GPT-Red, il super-hacker LLM che OpenAI usa per rendere più sicuri i suoi modelli
MIT Technology Review racconta GPT-Red, l’LLM che OpenAI ha addestrato come sparring partner per il red-teaming automatizzato: ha…
-
Bloccare gli attacchi slow-burn agli agenti con le policy contestuali di Omnigent
Databricks mostra come una policy contestuale stateful in Omnigent blocca un attacco di prompt injection indiretta dove ogni…
-
Prompt injection: la vulnerabilità che gli LLM si portano dietro per progettazione
La prompt injection sfrutta l’incapacità degli LLM di distinguere istruzioni e dati. Cos’è, perché è difficile da risolvere…