Zum Hauptinhalt
Intelliger
Leitfaden zur Sicherheit von KI-Agenten

AI Agent Security: Grenzen, Ausfälle und Kontrollen

Sicherheit von KI-Agenten über Abruf, Speicher, Tools und Ausführung: ein System-Grenzdiagramm, eine Fehlermatrix und praktische Tests für begrenzte Unternehmensaktionen.

Intelliger•
Quellen überprüft 27 September 2026 Unabhängige Unternehmenssicherheitsprüfung vor Veröffentlichung erforderlich Beispiele beschreiben ein Referenzdesign, nicht eine Kundenbereitstellung.

Die Sicherheit von KI-Agenten beschränkt, was ein Agent lesen, merken, vorschlagen und ausführen kann, auch wenn seine Eingaben oder sein Modellverhalten unzuverlässig sind. Schützen Sie das gesamte System: Datenzugriff, Laufzeitisolierung, Tooldefinitionen, Identität, delegierte Autorität, Anmeldeinformationen, Genehmigungen und Wiederherstellung. Behandeln Sie die Modellausgabe als Vorschlag. Eine separate Durchsetzungsstelle muss entscheiden, ob die genaue Aktion zulässig ist, bevor sie ein geschütztes System beeinflussen kann.

Dieses Handbuch richtet sich an Architekten und Sicherheitsingenieure, die einen Agenteneinsatz beurteilen. Berechtigungsleitfaden besitzt das Request-Level-Berechtigungsdesign und MCP-Sicherheit Diese sind Teile des hier beschriebenen Systems, neben Abruf, Speicher, Operatoren und Release Governance.

Zeichnen Sie die Sicherheitsgrenze des KI-Agenten

Beginnen Sie mit Assets und zulässigen Effekten und zeichnen Sie dann die Pfade, die sie verbinden. Identifizieren Sie sensible Quelldatensätze, persistenten Speicher, Ausführungsanmeldeinformationen, nachgelagerte Systeme und Beweisspeicherung. Markieren Sie jeden Punkt, an dem Daten zu einer Anweisung, einem Identitätsanspruch oder einer Anforderung zusätzlicher Rechte werden könnten.

Sources, users and tool responses          Owners and reviewers
            | untrusted content                    | trusted decisions
            v                                      v
     Retrieval / memory -> model runtime -> proposed action
            |                    |                 |
     data access policy    isolated workload       v
                                          independent enforcement
                                          identity / scope / approval
                                          reservation / credentials
                                                   |
                                                   v
                                            protected system
                                                   |
                                       observation / evidence / recovery

Das Diagramm ist eine Referenzarchitektur. Es wendet den ressourcenorientierten Ansatz in NIST SP 800-207Für Agenten stellt sich die praktische Frage, ob jede Route zu einem sinnvollen externen Effekt die beabsichtigten Steuerungen durchquert.

Getrennte Bedrohungen durch die Grenze, die sie überschreiten

Prompt Injection ist ein Fehlermodus, aber es ist nicht das gesamte Sicherheitsproblem. Ein Agent kann eine genaue Antwort liefern, während er die Aufzeichnungen des falschen Mandanten ausstellt. Er kann einer legitimen Benutzeranweisung folgen, während er ein delegiertes Budget überschreitet. Er kann das richtige Werkzeug verwenden, während er das Ziel ändert, nachdem ein Mensch die ursprüngliche Anfrage genehmigt hat.

GrenzeAusfallKontrollierenZu erhebende Nachweise
AbrufNicht autorisierte Datensätze betreten KontextQuell- und Feldzugriff vor dem Abrufen erzwingenVerweigerter Datensatz fehlt in der Modelleingabe
SpeicherUnvertrauenswürdige Inhalte werden zu persistenten AnweisungenGetrennte Herkunft und Autorität; einschränken schreibtMemory Change Attribution und Review
LaufzeitProzess gewinnt unbeabsichtigte Dateisystem- oder NetzwerkzugriffeArbeitsbelastung mit den geringsten Privilegien und eingeschränkte AusgängeIsolations- und Outbound-Access-Tests
WerkzeugkatalogNeues Tool erweitert leise die FähigkeitVersioniertes Inventar und FreigabegenehmigungToolschema diff und autorisierter Rollout
DelegationKinderagenten erhalten breitere RechteErzwingen Sie bei jeder Übergabe einen engeren AnwendungsbereichVergleich von Eltern/Kind-Einschränkung
AusführungGenehmigte Anfrage wird geändertBindende Genehmigung für geschützte AnfragefelderVor dem Versand abgelehnte Mutation
ErholungRetry wiederholt eine unsichere AktionDauerbetrieb Zustand und AbgleichUpstream Call Count und Endstatus

Ein Filter kann dabei helfen, verdächtige Eingaben zu identifizieren, aber er kann keine Überprüfung der Datenberechtigung, eine Atomreservierung oder eine unabhängige Genehmigung ersetzen.

Definieren Sie eine begrenzte Aktion, bevor Sie Tools gewähren

Als erstes Beispiel sei ein Mitarbeiter zur Vorbereitung von Beweisen verwendet. Er kann genehmigte Aufzeichnungen lesen und ein Paket für einen menschlichen Überprüfer entwerfen. Er darf die Quellenbeweise nicht verändern, die Einhaltung der Vorschriften bestätigen oder den zugrunde liegenden Fall schließen. Eine einzige Schreiboperation kann den genau genehmigten Entwurf an einem genehmigten Zielort veröffentlichen.

Einen Vertrag für diesen Vorgang aufzeichnen: verantwortlicher Eigentümer, Auftraggeber, Mandant, erlaubtes Werkzeug, erlaubter Bestimmungsort, erlaubte Datenklasse, Genehmigungsanforderung, Ablauf, Operationsschlüssel und Wiederherstellungsbesitzer. Den Vertrag außerhalb der Modellaufforderung halten. Die Eingabeaufforderung kann die Aufgabe erklären, während deterministischer Code seine Grenze durchsetzt, selbst wenn das Modell eine unangemessene Aktion vorschlägt.

Die Enterprise AI Agents Guide Er entwickelt diesen Workflow und seine Launch-Gates. Sein Wert ist eine kleine, überprüfbare Delegationsgrenze. Er ist kein Beweis dafür, dass jeder Prozess einen autonomen Agenten verwenden sollte, und er stellt keine Zahlungsbereitschaft, Produktionsinfrastrukturänderungen oder regulierte Entscheidungen her.

Testmissbrauch sowie erfolgreiche Ausführung

Die Agent Control Lab 1.0.0 Führen Sie nach der Extraktion diesen Befehl im extrahierten Verzeichnis mit Node.js 20 oder neuer aus:

node --test lab.test.mjs

Die Tests injizieren vertrauenswürdige Identitäts- und Genehmigungsobjekte in einen kleinen lokalen Simulator. Sie authentifizieren keine echten Benutzer. Sie stellen sicher, dass der Simulator eine falsche Zielgruppe, eine mieterübergreifende Anfrage, ein verbotenes Werkzeug, einen geänderten Zielort, einen geänderten Körper, eine abgelaufene Genehmigung, Selbstgenehmigung und einen nicht verfügbaren Richtlinien- oder Reservierungszustand blockiert. Jede verweigerte Einrichtung behauptet, dass keine simulierte vorgelagerte Aktion stattgefunden hat.

Erweitern Sie diese Fälle gegen das eigentliche System. Ersetzen Sie den Stub durch ein isoliertes Testziel, stellen Sie Testidentitäten bereit und beobachten Sie das Ziel unabhängig. Versuchen Sie einen direkten Aufruf, der das Gateway umgeht. Entfernen Sie eine Quellberechtigung und überprüfen Sie Modelleingaben. Ändern Sie ein genehmigtes Toolargument. Halten Sie den Agenten für eine Instanz aus und testen Sie eine andere Instanz. Das Fehlen einer unsicheren Antwort in natürlicher Sprache stellt nicht das Fehlen einer unsicheren Aktion dar.

Bei kontradiktorischen Dokumenten sind die injizierte Anweisung, die erlaubte Aufgabe, der vorgeschlagene Werkzeugaufruf und das Durchsetzungsergebnis aufzuzeichnen. Ein belastbarer Test kann auch dann bestehen, wenn das Modell den verbotenen Aufruf vorschlägt, sofern die unabhängige Grenze ihn zuverlässig blockiert und der Workflow die Ablehnung behandelt.

Planen von Incident Verhalten und Recovery

VorfallSofortige KontrolleWiedereinziehungsanforderung
Exposed Execution CredentialWiderrufen und Stoppen des betroffenen ZugriffsRotieren Sie Secret, untersuchen Sie die Verwendung und entfernen Sie den Expositionspfad
Vermutetes vergiftetes GedächtnisBeeinflusstes Gedächtnis isolieren und Schreiben aussetzenWiederherstellen von einer überprüften Version mit Provenienz
Policy oder Authority Service nicht verfügbarBeenden materieller MaßnahmenWiederherstellung des vertrauenswürdigen Zustands und Neubewertung der ausstehenden Arbeit
Timeout nach VersendungMarkergebnis unsicherAbgleich mit der ursprünglichen Betriebskennung
Werkzeugdefinition unerwartet geändertBlockieren Sie diese VersionÜberprüfungsschema und Wiederholungsabnahmetests
Nach Tätigwerden fehlende BeweiseEreignis aufzeichnen, ohne sich zu wiederholenBeobachtung wiederherstellen und fehlende Beweise bewerten

Ein Incident Runbook sollte angeben, welche Aktionen sofort gestoppt werden können, die sich möglicherweise bereits im Flug befinden und wie das geschützte System den Endzustand meldet. Eine generische Retry-Schleife kann einen Incident verschlimmern, wenn sie neue Operations-Identifier erzeugt oder einen nicht-idempotenten Effekt wiederholt.

Das Referenzlabor behält den unsicheren Zustand in einem Prozess bei und sendet nicht erneut für eine identische Wiederholung. Es implementiert keinen dauerhaften Abgleich oder verteilte Parallelität. Testen Sie diese Eigenschaften im realen Speicher und in der vorgelagerten Integration.

Nachweis, Bewertung und Eigentumsverhältnisse

Bewerten Sie die Antwortqualität, die Durchsetzung von Berechtigungen und die Wiederherstellung als unterschiedliche Ebenen. Verwenden Sie für die Antwortqualität repräsentative Aufgaben mit Nachweisanforderungen. Für die Durchsetzung, Testen von verweigerten Aktionen und Umgehungsversuchen. Simulieren Sie Fehler vor und nach dem Versand. Halten Sie Versionen des Modells, Aufforderungen, Werkzeugschemata, Richtlinien und Auswertungen fest, damit eine Änderung anhand der korrekten Baseline bewertet werden kann.

Die Freiwilligen NIST AI Risikomanagement Framework Sie bietet eine nützliche Governance-Struktur für Governance, Karte, Messen und Verwalten. Sie zertifiziert diese Architektur nicht. Weisen Sie operative Eigentümer und Überprüfungsgates zu, die den Auswirkungen Ihres eigenen Prozesses entsprechen. Checkliste der deutschen Regierung bietet ein editierbares Verantwortungs- und Beweisregister für deutschsprachige Teams.

Eine unterzeichnete Erklärung schützt Bytes unter einem ausgewählten Verifizierungsschlüssel; sie beweist nicht unabhängig, dass die externe Aktion stattgefunden hat oder dass der Datensatz vollständig ist. Leitfaden für den Audit-Trail für ein lauffähiges Beispiel für synthetische Verifikation und Manipulation.

Aktuelle Intelliger Grenze und nächster Schritt

Intelliger baut KI-Systeme, die konsequente Unternehmensarbeit sicher ausführen können. Agent Trust beschreibt die Kontrollschicht und das Enterprise Agent Gateway die gemeinsame Durchsetzungsgrenze. OATI ist eine Entwicklervorschau mit implementierten Komponenten und verbleibenden Produktions- und unabhängigen Review-Gates. Dieser Leitfaden und sein Labor sind pädagogisches Referenzmaterial, keine Sicherheitszertifizierung oder ein Anspruch auf Produktionsakzeptanz.

Verwenden Sie das Begrenzungsdiagramm, um eine geschützte Aktion und ihren Besitzer zu identifizieren. Guide Library oder verwenden Sie die Agent Trust Übersicht zu untersuchen, wo die Kontrollen in die breitere Architektur gehören.