AI Agent Security: Grenzen, Ausfälle und Kontrollen
Sicherheit von KI-Agenten über Abruf, Speicher, Tools und Ausführung: ein System-Grenzdiagramm, eine Fehlermatrix und praktische Tests für begrenzte Unternehmensaktionen.
Die Sicherheit von KI-Agenten beschränkt, was ein Agent lesen, merken, vorschlagen und ausführen kann, auch wenn seine Eingaben oder sein Modellverhalten unzuverlässig sind. Schützen Sie das gesamte System: Datenzugriff, Laufzeitisolierung, Tooldefinitionen, Identität, delegierte Autorität, Anmeldeinformationen, Genehmigungen und Wiederherstellung. Behandeln Sie die Modellausgabe als Vorschlag. Eine separate Durchsetzungsstelle muss entscheiden, ob die genaue Aktion zulässig ist, bevor sie ein geschütztes System beeinflussen kann.
Dieses Handbuch richtet sich an Architekten und Sicherheitsingenieure, die einen Agenteneinsatz beurteilen. Berechtigungsleitfaden besitzt das Request-Level-Berechtigungsdesign und MCP-Sicherheit Diese sind Teile des hier beschriebenen Systems, neben Abruf, Speicher, Operatoren und Release Governance.
Zeichnen Sie die Sicherheitsgrenze des KI-Agenten
Beginnen Sie mit Assets und zulässigen Effekten und zeichnen Sie dann die Pfade, die sie verbinden. Identifizieren Sie sensible Quelldatensätze, persistenten Speicher, Ausführungsanmeldeinformationen, nachgelagerte Systeme und Beweisspeicherung. Markieren Sie jeden Punkt, an dem Daten zu einer Anweisung, einem Identitätsanspruch oder einer Anforderung zusätzlicher Rechte werden könnten.
Sources, users and tool responses Owners and reviewers
| untrusted content | trusted decisions
v v
Retrieval / memory -> model runtime -> proposed action
| | |
data access policy isolated workload v
independent enforcement
identity / scope / approval
reservation / credentials
|
v
protected system
|
observation / evidence / recovery
Das Diagramm ist eine Referenzarchitektur. Es wendet den ressourcenorientierten Ansatz in NIST SP 800-207Für Agenten stellt sich die praktische Frage, ob jede Route zu einem sinnvollen externen Effekt die beabsichtigten Steuerungen durchquert.
Getrennte Bedrohungen durch die Grenze, die sie überschreiten
Prompt Injection ist ein Fehlermodus, aber es ist nicht das gesamte Sicherheitsproblem. Ein Agent kann eine genaue Antwort liefern, während er die Aufzeichnungen des falschen Mandanten ausstellt. Er kann einer legitimen Benutzeranweisung folgen, während er ein delegiertes Budget überschreitet. Er kann das richtige Werkzeug verwenden, während er das Ziel ändert, nachdem ein Mensch die ursprüngliche Anfrage genehmigt hat.
| Grenze | Ausfall | Kontrollieren | Zu erhebende Nachweise |
|---|---|---|---|
| Abruf | Nicht autorisierte Datensätze betreten Kontext | Quell- und Feldzugriff vor dem Abrufen erzwingen | Verweigerter Datensatz fehlt in der Modelleingabe |
| Speicher | Unvertrauenswürdige Inhalte werden zu persistenten Anweisungen | Getrennte Herkunft und Autorität; einschränken schreibt | Memory Change Attribution und Review |
| Laufzeit | Prozess gewinnt unbeabsichtigte Dateisystem- oder Netzwerkzugriffe | Arbeitsbelastung mit den geringsten Privilegien und eingeschränkte Ausgänge | Isolations- und Outbound-Access-Tests |
| Werkzeugkatalog | Neues Tool erweitert leise die Fähigkeit | Versioniertes Inventar und Freigabegenehmigung | Toolschema diff und autorisierter Rollout |
| Delegation | Kinderagenten erhalten breitere Rechte | Erzwingen Sie bei jeder Übergabe einen engeren Anwendungsbereich | Vergleich von Eltern/Kind-Einschränkung |
| Ausführung | Genehmigte Anfrage wird geändert | Bindende Genehmigung für geschützte Anfragefelder | Vor dem Versand abgelehnte Mutation |
| Erholung | Retry wiederholt eine unsichere Aktion | Dauerbetrieb Zustand und Abgleich | Upstream Call Count und Endstatus |
Ein Filter kann dabei helfen, verdächtige Eingaben zu identifizieren, aber er kann keine Überprüfung der Datenberechtigung, eine Atomreservierung oder eine unabhängige Genehmigung ersetzen.
Definieren Sie eine begrenzte Aktion, bevor Sie Tools gewähren
Als erstes Beispiel sei ein Mitarbeiter zur Vorbereitung von Beweisen verwendet. Er kann genehmigte Aufzeichnungen lesen und ein Paket für einen menschlichen Überprüfer entwerfen. Er darf die Quellenbeweise nicht verändern, die Einhaltung der Vorschriften bestätigen oder den zugrunde liegenden Fall schließen. Eine einzige Schreiboperation kann den genau genehmigten Entwurf an einem genehmigten Zielort veröffentlichen.
Einen Vertrag für diesen Vorgang aufzeichnen: verantwortlicher Eigentümer, Auftraggeber, Mandant, erlaubtes Werkzeug, erlaubter Bestimmungsort, erlaubte Datenklasse, Genehmigungsanforderung, Ablauf, Operationsschlüssel und Wiederherstellungsbesitzer. Den Vertrag außerhalb der Modellaufforderung halten. Die Eingabeaufforderung kann die Aufgabe erklären, während deterministischer Code seine Grenze durchsetzt, selbst wenn das Modell eine unangemessene Aktion vorschlägt.
Die Enterprise AI Agents Guide Er entwickelt diesen Workflow und seine Launch-Gates. Sein Wert ist eine kleine, überprüfbare Delegationsgrenze. Er ist kein Beweis dafür, dass jeder Prozess einen autonomen Agenten verwenden sollte, und er stellt keine Zahlungsbereitschaft, Produktionsinfrastrukturänderungen oder regulierte Entscheidungen her.
Testmissbrauch sowie erfolgreiche Ausführung
Die Agent Control Lab 1.0.0 Führen Sie nach der Extraktion diesen Befehl im extrahierten Verzeichnis mit Node.js 20 oder neuer aus:
node --test lab.test.mjs
Die Tests injizieren vertrauenswürdige Identitäts- und Genehmigungsobjekte in einen kleinen lokalen Simulator. Sie authentifizieren keine echten Benutzer. Sie stellen sicher, dass der Simulator eine falsche Zielgruppe, eine mieterübergreifende Anfrage, ein verbotenes Werkzeug, einen geänderten Zielort, einen geänderten Körper, eine abgelaufene Genehmigung, Selbstgenehmigung und einen nicht verfügbaren Richtlinien- oder Reservierungszustand blockiert. Jede verweigerte Einrichtung behauptet, dass keine simulierte vorgelagerte Aktion stattgefunden hat.
Erweitern Sie diese Fälle gegen das eigentliche System. Ersetzen Sie den Stub durch ein isoliertes Testziel, stellen Sie Testidentitäten bereit und beobachten Sie das Ziel unabhängig. Versuchen Sie einen direkten Aufruf, der das Gateway umgeht. Entfernen Sie eine Quellberechtigung und überprüfen Sie Modelleingaben. Ändern Sie ein genehmigtes Toolargument. Halten Sie den Agenten für eine Instanz aus und testen Sie eine andere Instanz. Das Fehlen einer unsicheren Antwort in natürlicher Sprache stellt nicht das Fehlen einer unsicheren Aktion dar.
Bei kontradiktorischen Dokumenten sind die injizierte Anweisung, die erlaubte Aufgabe, der vorgeschlagene Werkzeugaufruf und das Durchsetzungsergebnis aufzuzeichnen. Ein belastbarer Test kann auch dann bestehen, wenn das Modell den verbotenen Aufruf vorschlägt, sofern die unabhängige Grenze ihn zuverlässig blockiert und der Workflow die Ablehnung behandelt.
Planen von Incident Verhalten und Recovery
| Vorfall | Sofortige Kontrolle | Wiedereinziehungsanforderung |
|---|---|---|
| Exposed Execution Credential | Widerrufen und Stoppen des betroffenen Zugriffs | Rotieren Sie Secret, untersuchen Sie die Verwendung und entfernen Sie den Expositionspfad |
| Vermutetes vergiftetes Gedächtnis | Beeinflusstes Gedächtnis isolieren und Schreiben aussetzen | Wiederherstellen von einer überprüften Version mit Provenienz |
| Policy oder Authority Service nicht verfügbar | Beenden materieller Maßnahmen | Wiederherstellung des vertrauenswürdigen Zustands und Neubewertung der ausstehenden Arbeit |
| Timeout nach Versendung | Markergebnis unsicher | Abgleich mit der ursprünglichen Betriebskennung |
| Werkzeugdefinition unerwartet geändert | Blockieren Sie diese Version | Überprüfungsschema und Wiederholungsabnahmetests |
| Nach Tätigwerden fehlende Beweise | Ereignis aufzeichnen, ohne sich zu wiederholen | Beobachtung wiederherstellen und fehlende Beweise bewerten |
Ein Incident Runbook sollte angeben, welche Aktionen sofort gestoppt werden können, die sich möglicherweise bereits im Flug befinden und wie das geschützte System den Endzustand meldet. Eine generische Retry-Schleife kann einen Incident verschlimmern, wenn sie neue Operations-Identifier erzeugt oder einen nicht-idempotenten Effekt wiederholt.
Das Referenzlabor behält den unsicheren Zustand in einem Prozess bei und sendet nicht erneut für eine identische Wiederholung. Es implementiert keinen dauerhaften Abgleich oder verteilte Parallelität. Testen Sie diese Eigenschaften im realen Speicher und in der vorgelagerten Integration.
Nachweis, Bewertung und Eigentumsverhältnisse
Bewerten Sie die Antwortqualität, die Durchsetzung von Berechtigungen und die Wiederherstellung als unterschiedliche Ebenen. Verwenden Sie für die Antwortqualität repräsentative Aufgaben mit Nachweisanforderungen. Für die Durchsetzung, Testen von verweigerten Aktionen und Umgehungsversuchen. Simulieren Sie Fehler vor und nach dem Versand. Halten Sie Versionen des Modells, Aufforderungen, Werkzeugschemata, Richtlinien und Auswertungen fest, damit eine Änderung anhand der korrekten Baseline bewertet werden kann.
Die Freiwilligen NIST AI Risikomanagement Framework Sie bietet eine nützliche Governance-Struktur für Governance, Karte, Messen und Verwalten. Sie zertifiziert diese Architektur nicht. Weisen Sie operative Eigentümer und Überprüfungsgates zu, die den Auswirkungen Ihres eigenen Prozesses entsprechen. Checkliste der deutschen Regierung bietet ein editierbares Verantwortungs- und Beweisregister für deutschsprachige Teams.
Eine unterzeichnete Erklärung schützt Bytes unter einem ausgewählten Verifizierungsschlüssel; sie beweist nicht unabhängig, dass die externe Aktion stattgefunden hat oder dass der Datensatz vollständig ist. Leitfaden für den Audit-Trail für ein lauffähiges Beispiel für synthetische Verifikation und Manipulation.
Aktuelle Intelliger Grenze und nächster Schritt
Intelliger baut KI-Systeme, die konsequente Unternehmensarbeit sicher ausführen können. Agent Trust beschreibt die Kontrollschicht und das Enterprise Agent Gateway die gemeinsame Durchsetzungsgrenze. OATI ist eine Entwicklervorschau mit implementierten Komponenten und verbleibenden Produktions- und unabhängigen Review-Gates. Dieser Leitfaden und sein Labor sind pädagogisches Referenzmaterial, keine Sicherheitszertifizierung oder ein Anspruch auf Produktionsakzeptanz.
Verwenden Sie das Begrenzungsdiagramm, um eine geschützte Aktion und ihren Besitzer zu identifizieren. Guide Library oder verwenden Sie die Agent Trust Übersicht zu untersuchen, wo die Kontrollen in die breitere Architektur gehören.