Georgios Pantazopoulos、Amit Parekh、Malvina Nikandrou、Alessandro Suglia
赋予大语言模型(LLMs)图像理解能力催生了一大批高性能的视觉-语言模型(VLMs)。尽管 LLM 与人类价值观对齐的研究已受到广泛关注,VLMs 的安全性却未获得同等重视。本文探讨了越狱攻击对三个最新 VLMs 的影响,这三个模型各自采用了不同的建模方法。通过将每个 VLM 与其对应的 LLM 骨干模型进行比较,研究发现每个 VLM 都更容易受到越狱攻击。作者认为这是视觉指令微调带来的不良后果——该过程对 LLM 的安全护栏产生了“遗忘效应”。因此,论文基于评估策略提出了未来工作的建议,旨在揭示 VLM 的弱点,并在视觉指令微调过程中纳入安全考量。