| name | defense-against-llm-backdoors-using-critical-neuro |
| description | Skill generated from arXiv paper 2607.19894: Defense Against LLM Backdoors using Critical Neuron Isolation Pruning |
| metadata | {"arxiv":{"id":"2607.19894","title":"Defense Against LLM Backdoors using Critical Neuron Isolation Pruning","authors":["Yuxi Li","Zhibo Zhang","Kailong Wang","Xingshuo Han","Ling Shi","Haoyu Wang"],"published":"2026-07-22","categories":["cs.CR","cs.AI"],"url":"https://arxiv.org/abs/2607.19894","utility":1}} |
Defense Against LLM Backdoors using Critical Neuron Isolation Pruning
arXiv: 2607.19894
Published: 2026-07-22
Authors: Yuxi Li, Zhibo Zhang, Kailong Wang, Xingshuo Han, Ling Shi, Haoyu Wang
Categories: cs.CR, cs.AI
Utility: 1.00
Key Innovation
Large language models (LLMs) are vulnerable to backdoor attacks, where hidden triggers induce malicious outputs. Existing defenses generally fall into inference-time detection or training-time mitigation, but face two key limitations. First, they focus on fine-tuning-based backdoors (e.g., PEFT modules) and fail to address insidious model-editing attacks that bypass training pipelines. Second, they target simple classification settings and do not naturally extend to open-ended LLM generation and...
Potential Application
This paper presents advancements that could be applied to enhance agent capabilities in the areas of cs.CR, cs.AI.
References