Ich teste dein LLM-Agent auf Angriff für Prompt-Injection und Memory-Attacken

S
sidharth1
S
sidharth1
Sidharth P
Einige Informationen wurden automatisch übersetzt.

Über diesen Service

Automatische Übersetzung

Ist dein LLM-Agent sicher genug, um vor echten Nutzern eingesetzt zu werden? Ich greife ihn so an, wie es ein echter Angreifer tun würde, und sage dir genau, was kaputt geht und wie du es beheben kannst.


Ich bin KI-Sicherheitsforscher mit Veröffentlichungen auf ICML und IJCNLP sowie arXiv-Arbeiten zu Memory-Attacken gegen LLM-Agenten. Ich habe auch Evaluierungs-Benchmarks wie LLM-judge entwickelt, sodass meine Tests systematisch und reproduzierbar sind, nicht nur eine Handvoll cleverer Prompts.


Was ich teste:

  • Prompt-Injection (direkt und über Dokumente, Webseiten oder Tool-Ausgaben)
  • Jailbreaks und Policy-Bypass
  • Missbrauch von Tools und Funktionsaufrufen
  • Memory- und Kontextvergiftung bei Agenten mit Langzeitgedächtnis
  • System-Prompt- und Datenlecks


Was du bekommst:

Ein klarer schriftlicher Bericht mit jedem Fund, einem reproduzierbaren Beispiel, einer Schweregradbewertung und einer konkreten Lösung. Höherpreisige Pakete enthalten die Angriffssuite als Code, damit du sie erneut ausführen kannst, plus einen Retest nach deiner Patch-Implementierung.


Funktioniert mit OpenAI, Anthropic, Open-Source-Modellen, LangChain, LlamaIndex und eigenen Agenten-Stacks. Schreib mir zuerst eine kurze Beschreibung deines Agents, und ich bestätige den Umfang. Ich teste nur Systeme, die du besitzt oder für die du die Erlaubnis hast.

Lerne Sidharth P kennen

Sidharth P

AI Safety Researcher and LLM Fine Tuning Expert

  • AusIndien
  • Mitglied seitApr. 2017
  • Sprachen

    Telugu, Englisch, Hindi
AI researcher in LLM safety and NLP. Research Intern at AI4Bharat (first author of IndicBERT-v3, open multilingual encoder LLMs) and Research Fellow at SPAR. Papers at ICML 2026 and IJCNLP-AACL 2025, plus arXiv work on memory attacks against LLM agents. Hands-on with LoRA/QLoRA and full fine-tuning (SFT, GRPO), multi-GPU training on H100s, vLLM/SGLang inference and LLM-as-judge evaluation. I help teams fine-tune open-source LLMs, build evaluation pipelines, red-team LLM agents and reproduce ML papers. Message me your goal and I will reply with a clear plan.

Automatische Übersetzung

Mein Portfolio

Meine weiteren Dienstleistungen im Bereich KI-Entwicklung

Verwandte Tags