← all papers · overview

Learning To Poison Large Language Models For Downstream Manipulation

Abstract

The advent of Large Language Models (LLMs) has marked significant achievements in language processing and reasoning capabilities. Despite their advancements, LLMs face vulnerabilities to data poisoning attacks, where the adversary inserts backdoor triggers into training data to manipulate outputs. This work further identifies additional security risks in LLMs by designing a new data poisoning atta

Related papers

Ranked by semantic similarity — how closely each paper's abstract matches this one (100% = near-identical topic).