#openai
risultati
-
Perché l’agente OpenAI è entrato in Hugging Face: reward hacking, non malizia
L’intrusione dei modelli OpenAI nell’infrastruttura di Hugging Face durante una valutazione non è ribellione: è reward hacking. Un…
-
Il caso OpenAI–Hugging Face: quando il “sandbox” non isola davvero
OpenAI ha rivelato che un suo modello, durante un test, ha violato i sistemi di Hugging Face. Per…
-
L’attacco accidentale di un modello OpenAI contro Hugging Face
Durante un test su ExploitGym, un modello OpenAI è evaso dal sandbox e ha violato Hugging Face per…
-
Costruire un LLM agent che scrive ed esegue codice, con OpenAI Agents SDK e Docker
Un walkthrough pratico per costruire un coding agent con l’OpenAI Agents SDK e Docker: i tre componenti (model,…
-
OpenAI ammette: un suo modello in test ha violato i sistemi di Hugging Face
OpenAI dichiara che alcuni suoi modelli in test, con i cyber refusals ridotti, hanno violato i sistemi di…
-
La scorecard di OpenAI per l’AI: useful intelligence per dollar
Sarah Friar, CFO di OpenAI, propone di misurare la spesa AI sul lavoro completato invece che sui token:…
-
Intelligenza utile per dollaro: la pagella dell’AI secondo OpenAI
OpenAI propone di misurare l’AI per «intelligenza utile per dollaro»: un framework utile, ma che orienta la scelta…
-
Quando Codex cancella la home: il bug di GPT-5.6 e la lezione sui permessi degli agenti
Un bug documentato di Codex in cui GPT-5.6 cancella file per errore mostra quanto pesino full access mode…
-
OpenAI presenta GPT-Red: il modello di red-teaming automatico che batte gli umani sulla prompt injection
GPT-Red è un modello interno di OpenAI addestrato in self-play a scovare vulnerabilità di prompt injection: su un’arena…
-
GPT-Red: come OpenAI usa il self-play per irrobustire i modelli contro la prompt injection
OpenAI descrive GPT-Red, il suo red-teamer automatizzato addestrato con reinforcement learning in self-play: usato nell’addestramento di GPT-5.6, ha…