Awesome Large Language Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
adversarial
loadingβ¦
π€
Ask AI
Awesome adversarial β curated papers, datasets & benchmarks Β· Awesome Large Language Models
β all topics
overview
adversarial
24 papers tagged adversarial β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
24 papers Β· trending (default)
numbers = π₯ heat
COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs
(2026)
Dasol Choi et al.
1.94
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
(2026)
Nahyun Lee et al.
1.94
Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models
(2026)
Malikeh Ehghaghi et al.
1.94
ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration
(2026)
Ruofeng Yang et al.
1.89
The Chain Holds, the Answer Folds: Trace-Answer Dissociation in Reasoning Models Under Adversarial Pressure
(2026)
Yubo Li et al.
1.89
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
(2026)
Sudong Wang et al.
1.83
Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling
(2026)
Mingqian Feng et al.
1.67
The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1
(2025)
Kaiwen Zhou et al.
1.28
Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models
(2025)
Thomas Winninger et al.
1.28
SANA-Sprint: One-Step Diffusion with Continuous-Time Consistency Distillation
(2025)
Junsong Chen et al.
1.28
Adversarial Attacks against Closed-Source MLLMs via Feature Optimal Alignment
(2025)
Xiaojun Jia et al.
1.28
Cascading Adversarial Bias from Injection to Distillation in Language Models
(2025)
Harsh Chaudhari et al.
1.28
TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems
(2025)
Shaina Raza et al.
1.28
SAFEFLOW: A Principled Protocol for Trustworthy and Transactional Autonomous Agent Systems
(2025)
Peiran Li et al.
1.28
Finding Dori: Memorization in Text-to-Image Diffusion Models Is Less Local Than Assumed
(2025)
Antoni Kowalczuk et al.
1.28
AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models
(2025)
Zihao Zhu et al.
1.28
Imperceptible Jailbreaking against Large Language Models
(2025)
Kuofeng Gao et al.
1.28
CLINIC: Evaluating Multilingual Trustworthiness in Language Models for Healthcare
(2025)
Akash Ghosh et al.
1.28
Hybrid Attribution Priors for Explainable and Robust Model Training
(2025)
Zhuoran Zhang et al.
1.28
Jailbroken: How Does LLM Safety Training Fail?
(2023)
Alexander Wei et al.
β
Moral Foundations of Large Language Models
(2023)
Marwa Abdulhai et al.
β
Can LLMs Follow Simple Rules?
(2023)
Norman Mu et al.
β
WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models
(2024)
Liwei Jiang et al.
β
Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders
(2024)
David Noever et al.
β