OpenAPA: una vecchia idea militare per bloccare la prompt injection negli agenti (senza nuovi chip)
Classificare una sessione come “segreta” dopo l’accesso a dati sensibili e impedire, in modo deterministico, che finisca in contesti meno sicuri. Il problema reale: gli agenti non distinguono “chi comanda” Gli agenti basati su LLM sono bravissimi a portare a termine task complessi, ma hanno una debolezza strutturale: faticano a separare le istruzioni dell’utente da input ostili infilati in…
Un sistema innovativo chiamato OpenAPA propone un nuovo approccio per prevenire l'iniezione di prompt negli agenti basati su LLM (Language Model). Questa soluzione si basa su un modello di sicurezza sviluppato in contesti militari classificati, dove i documenti hanno livelli di classificazione e possono essere accessibili solo dalle stanze autorizzate.
Nello sviluppo di OpenAPA, ogni risorsa e destinazione (file, repository, strumenti, endpoint) può essere assegnata un livello di classificazione, come pubblico o privato. La sessione dell'agente eredita il livello di classificazione più alto dei dati che ha letto. Alcune azioni che cercano di esfiltrare informazioni verso destinazioni di classificazione inferiore vengono quindi bloccate o richiedono una approvazione esplicita.
Questa soluzione si distinguerebbe perché non si basa sulla valutazione delle "bontà" delle intenzioni dell'LLM, ma su regole deterministiche. Ciò rende la protezione indipendente dal prompt, garantendo che anche una prompt injection perfetta non altererà le politiche. Ad esempio, un file privato che non deve essere esposto in un'issue pubblica sarebbe protetto, impedendo che il modello invii dati sensibili in ambienti meno sicuri.
Una caratteristica notevole di OpenAPA è il rifiuto deterministico delle azioni, che non dipende dall'umore del modello. Inoltre, fornisce tracciabilità, ovvero si sa quale regola ha bloccato una determinata azione, facilitando l'audit e il debugging. Tuttavia, il costo in termini di produttività e consumo di token è una considerazione importante da prendere in considerazione.
In sintesi, OpenAPA offre una soluzione basata su politiche e limiti che mette la sicurezza prima del completamento dei compiti e del costo operativo, con un focus sui confini e sull'isolamento degli agenti dagli strumenti per prevenire l'iniezione di prompt e l'esfiltrazione di informazioni sensibili.
Written by urgent.news from Dev.to's reporting — not their text. Machine-written — may contain errors; check the original before relying on it.