← all datasets

DirectHarm-4

Emerging
1papers using it
2026first seen

The 'DirectHarm-4' dataset/benchmark is used to evaluate the safety and refusal behavior of language models during fine-tuning, specifically assessing how well models maintain their safety-relevant representations.

Papers using DirectHarm-4 (1)

DirectHarm-4 dataset — papers, benchmarks & downloads · Cybersecurity