Ich teste dein LLM-Agent auf Angriff für Prompt-Injection und Memory-Attacken


Über diesen Service
Automatische Übersetzung
Ist dein LLM-Agent sicher genug, um vor echten Nutzern eingesetzt zu werden? Ich greife ihn so an, wie es ein echter Angreifer tun würde, und sage dir genau, was kaputt geht und wie du es beheben kannst.
Ich bin KI-Sicherheitsforscher mit Veröffentlichungen auf ICML und IJCNLP sowie arXiv-Arbeiten zu Memory-Attacken gegen LLM-Agenten. Ich habe auch Evaluierungs-Benchmarks wie LLM-judge entwickelt, sodass meine Tests systematisch und reproduzierbar sind, nicht nur eine Handvoll cleverer Prompts.
Was ich teste:
- Prompt-Injection (direkt und über Dokumente, Webseiten oder Tool-Ausgaben)
- Jailbreaks und Policy-Bypass
- Missbrauch von Tools und Funktionsaufrufen
- Memory- und Kontextvergiftung bei Agenten mit Langzeitgedächtnis
- System-Prompt- und Datenlecks
Was du bekommst:
Ein klarer schriftlicher Bericht mit jedem Fund, einem reproduzierbaren Beispiel, einer Schweregradbewertung und einer konkreten Lösung. Höherpreisige Pakete enthalten die Angriffssuite als Code, damit du sie erneut ausführen kannst, plus einen Retest nach deiner Patch-Implementierung.
Funktioniert mit OpenAI, Anthropic, Open-Source-Modellen, LangChain, LlamaIndex und eigenen Agenten-Stacks. Schreib mir zuerst eine kurze Beschreibung deines Agents, und ich bestätige den Umfang. Ich teste nur Systeme, die du besitzt oder für die du die Erlaubnis hast.
Lerne Sidharth P kennen
AI Safety Researcher and LLM Fine Tuning Expert
- AusIndien
- Mitglied seitApr. 2017
Sprachen
Telugu, Englisch, Hindi
Automatische Übersetzung
Mein Portfolio
Meine weiteren Dienstleistungen im Bereich KI-Entwicklung
FAQ
Automatische Übersetzung
Benötigst du Zugriff auf mein Produktionssystem?
Nein. Ich kann eine Staging-Kopie, einen API-Endpunkt mit Test-Key oder eine Prompt- und Tool-Spezifikation, die du teilst, testen. Ich teste nur Systeme, die du besitzt oder für die du die Erlaubnis hast, und benötige niemals echte Nutzerdaten.
Was muss ich mitteilen, um loszulegen?
Einen Test-Endpunkt oder eine Staging-Version deines Agents, seinen System-Prompt, die Tools, die er aufrufen kann, und was er niemals tun darf. Wenn er Langzeitgedächtnis hat oder Dokumente oder Webseiten liest, sag mir das, da diese häufige Angriffspfade sind.
Wirst du meine Systeme und Erkenntnisse vertraulich behandeln?
Ja. Deine Prompts, Code, Daten und Erkenntnisse werden nur für dein Projekt verwendet und nur mit dir geteilt. Ich veröffentliche oder reuse nichts, was spezifisch für dein System ist.
Welche Modelle und Frameworks unterstützt du?
Agenten, die auf OpenAI, Anthropic, Gemini oder Open-Source-Modellen (Llama, Qwen, Mistral und andere) basieren, mit LangChain, LlamaIndex, CrewAI, MCP-Tools oder einem eigenen Stack. Wenn sie Text eingeben, kann ich sie testen.

