Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
attack
loadingβ¦
π€
Ask AI
Awesome attack β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
attack
13 papers tagged attack β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
13 papers Β· trending (default)
numbers = π₯ heat
Practical Graph Optimisation and AI-Driven Models for Active Directory Security Hardening
(2026)
Huy Q. Ngo
5.01
From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors
(2026)
Jiejun Tan et al.
1.94
Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models
(2026)
Malikeh Ehghaghi et al.
1.94
Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?
(2026)
Yimeng Chen et al.
1.94
Learning to Detect Language Model Training Data via Active Reconstruction
(2026)
Junjie Oscar Yin et al.
1.72
Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling
(2026)
Mingqian Feng et al.
1.67
Security Without Detection: Economic Denial as a Primitive for Edge and IoT Defense
(2025)
Samaresh Kumar Singh et al.
1.61
X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
(2025)
Salman Rahman et al.
1.28
Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols
(2025)
Mikhail Terekhov et al.
1.28
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
(2025)
Xiaojun Jia et al.
1.28
Can LLMs Follow Simple Rules?
(2023)
Norman Mu et al.
β
Stealing Part of a Production Language Model
(2024)
Nicholas Carlini et al.
β
AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
(2024)
Zhaorun Chen et al.
β