LLM 跨語言繞過與安全

在 AIS3 暑期研究中,測試低資源語言與自創語言對 LLM prompt injection 防禦的影響。

Prompt Injection Jailbreak Evaluation Multilingual Evaluation LLM Security

如果安全測試只用主流語言,防線真的一樣嗎?

許多 prompt injection 與 jailbreak 測試習慣用英文或其他主流語言描述。那麼,模型遇到低資源語言,或遇到人類平常不會使用的自創語言時,原本的防禦還能不能用同樣方式理解?這是我在 AIS3 暑期研究裡想拆開看的問題。

我沒有把它簡化成「換一種語言就一定能繞過」。真正需要比較的是:攻擊提示的語意、語言條件、模型回應和判斷標準是否被放在同一個測試框架裡,否則最後看到的差異可能只是測試流程不一致。

把語言變化放進可比較的測試流程

我負責低資源語言組的實驗設計、實作和相關論文研究;全新構造語言由另一組成員負責,兩者的結果不在這頁混為一談。本組報告流程以 MultiJail 的 315 個 harmful questions 為輸入,翻譯成英文、繁體中文、爪哇語、緬甸語、泰語、越南語、塔加洛語和世界語八個報告條件,再比較不加 PSA wrapper 與加入 Paper Summary Attack(PSA)wrapper 的差異。

五個 victim LLM 讀取相同條件的提示;Gemma 4 12B 負責輸出篩選,StrongREJECT Gemma2B 負責 judge。從 MultiJail(315 題)經八語言翻譯與 None/PSA wrapper,到五個 victim LLM 和兩階段判定的流程如圖所示。

跨語言 prompt injection 的實驗流程與結果指標

這樣的設計把語言條件、攻擊包裝、模型回應和判定流程固定在同一個比較框架裡;結果可以回到具體輸入和判定,而不是只挑一個最戲劇化的成功案例。下表沿用簡報中的 ASR 與 RR (%) 欄位名稱與數值,沒有自行補寫簡報未提供的 ASR 公式。

觀察到的結果:PSA 同時降低 RR 與 ASR

指標/條件 English zh-TW Javanese Burmese Thai Vietnamese Tagalog Esperanto
ASR (%) — None 3.9 3.7 1.4 3.5 3.3 4.8 2.0 3.2
ASR (%) — PSA 1.43 1.12 0.97 1.30 1.13 0.48 0.49 1.94
RR (%) — None 66.51 61.21 40.65 16.40 59.74 58.76 55.68 53.37
RR (%) — PSA 31.00 23.50 14.00 16.29 26.00 23.80 24.50 16.86

在這組 315 題、八語言、五模型的條件下,PSA 的 RR 和 ASR 都比 None 條件低;因此它不能被解讀成更有效的攻擊。投影片也記錄,部分輸出是在摘要論文,而不是回應 harmful prompt,這是為什麼較低的 RR 不等於成功繞過,也不代表更高的攻擊品質。

能說明什麼,不能說明什麼

這個研究讓我練習的技術能力包括測試條件設計、跨語言提示整理、模型回應評估,以及把安全結論限制在實際測試範圍內。它能說明語言覆蓋、攻擊包裝和判定器是 LLM 安全評估需要明確記錄的變因,也能留下後續重跑和比較的框架。

它不能直接推出所有模型、所有低資源語言都具有相同風險,更不能用一次測試替代部署環境的完整安全評估。模型版本、提示內容、翻譯品質、PSA wrapper、篩選/judge 設定和評估標準都會影響觀察結果;因此這頁不宣稱通用繞過率或單一模型的普遍結論。

我會保留的研究原則

這次我更在意測試條件是否一致、結果是否能被重新檢查,而不是只尋找一個最醒目的 bypass。對 LLM 安全來說,能說清楚「在哪個條件下觀察到什麼」本身就是研究結果的一部分。

完整內容見 AIS3 研究簡報。