SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge
Mubarak Shah, Joseph Fioresi, James Beetham, Adeel Yousaf, Amrit Singh Bedi
aaai
Research metadataShow detailsHide details
- Affiliations
- Not available
- Published
- 2026-03-17
- Processed
- 7/25/2026, 12:57:35 PM
- Analysis model
- gemini-2.5-flash
- Analysis status
- analyzed
- Local PDF artifact
- papers/pdf/2026/safer-clip-mitigating-nsfw-content-in-vision-language-models.pdf
Summary
This paper introduces SafeR-CLIP, a fine-tuning framework designed to mitigate Not Safe For Work (NSFW) content in Vision-Language Models (VLMs) while preserving their pre-trained knowledge and generalization capabilities. The core idea is proximity-aware realignment, which redirects unsafe concepts to their semantically closest safe alternatives, minimizing representational change. SafeR-CLIP employs novel representation-aware losses, including relative cross-modal redirection and proximity-based alignment, along with a progressive training strategy. The method achieves state-of-the-art results, recovering up to 8.0% in zero-shot accuracy over prior safety fine-tuning approaches while maintaining robust safety.
Problem
The paper identifies several bottlenecks with existing methods for mitigating NSFW content in VLMs:
- Performance-Safety Trade-off: Fine-tuning VLMs for safety often leads to significant drops in generalization performance, with prominent methods incurring a substantial 22% drop in zero-shot accuracy on standard benchmarks.