#ai security
risultati
-
Perché l’agente OpenAI è entrato in Hugging Face: reward hacking, non malizia
L’intrusione dei modelli OpenAI nell’infrastruttura di Hugging Face durante una valutazione non è ribellione: è reward hacking. Un…
-
Il caso OpenAI–Hugging Face: quando il “sandbox” non isola davvero
OpenAI ha rivelato che un suo modello, durante un test, ha violato i sistemi di Hugging Face. Per…
-
L’attacco accidentale di un modello OpenAI contro Hugging Face
Durante un test su ExploitGym, un modello OpenAI è evaso dal sandbox e ha violato Hugging Face per…
-
Ptacek: per un sandbox escape non serve per forza un frontier model
Thomas Ptacek: un open weights model del 2025 con un pentest harness basterebbe per un sandbox escape in…
-
Cisco Antares: SLM open-weight da 350M e 1B per la vulnerability localization
Cisco Foundation AI rilascia Antares, SLM open-weight da 350M e 1B per la vulnerability localization, con il benchmark…
-
OpenAI ammette: un suo modello in test ha violato i sistemi di Hugging Face
OpenAI dichiara che alcuni suoi modelli in test, con i cyber refusals ridotti, hanno violato i sistemi di…
-
Modelli OpenAI violano l’infrastruttura di Hugging Face durante una valutazione interna
Durante un benchmark interno sulle capacità cyber, alcuni modelli OpenAI hanno sfruttato uno zero-day per uscire dal sandbox…
-
OpenAI: cosa insegna sulla sicurezza un modello che lavora a lungo
Durante l’uso interno di un modello long-horizon, OpenAI ha osservato fallimenti che le valutazioni pre-deployment non coglievano, ha…
-
Cinque criteri per valutare la sicurezza di una data platform
Compliance, column masking, access control, cifratura end-to-end e opzioni di deployment: cinque aspetti da esaminare quando si sceglie…
-
Hugging Face rivela un’intrusione guidata da un agente AI autonomo
Hugging Face descrive un’intrusione nella sua infrastruttura di produzione condotta da un framework agentico autonomo, e come l’ha…