如果安全測試只用主流語言,防線真的一樣嗎?
許多 prompt injection 與 jailbreak 測試習慣用英文或其他主流語言描述。那麼,模型遇到低資源語言,或遇到人類平常不會使用的自創語言時,原本的防禦還能不能用同樣方式理解?這是我在 AIS3 暑期研究裡想拆開看的問題。
我沒有把它簡化成「換一種語言就一定能繞過」。真正需要比較的是:攻擊提示的語意、語言條件、模型回應和判斷標準是否被放在同一個測試框架裡,否則最後看到的差異可能只是測試流程不一致。
把語言變化放進可比較的測試流程
我負責低資源語言組的實驗設計、實作和相關論文研究;全新構造語言由另一組成員負責,兩者的結果不在這頁混為一談。本組報告流程以 MultiJail 的 315 個 harmful questions 為輸入,翻譯成英文、繁體中文、爪哇語、緬甸語、泰語、越南語、塔加洛語和世界語八個報告條件,再比較不加 PSA wrapper 與加入 Paper Summary Attack(PSA)wrapper 的差異。
五個 victim LLM 讀取相同條件的提示;Gemma 4 12B 負責輸出篩選,StrongREJECT Gemma2B 負責 judge。從 MultiJail(315 題)經八語言翻譯與 None/PSA wrapper,到五個 victim LLM 和兩階段判定的流程如圖所示。
這樣的設計把語言條件、攻擊包裝、模型回應和判定流程固定在同一個比較框架裡;結果可以回到具體輸入和判定,而不是只挑一個最戲劇化的成功案例。下表沿用簡報中的 ASR 與 RR (%) 欄位名稱與數值,沒有自行補寫簡報未提供的 ASR 公式。
觀察到的結果:PSA 同時降低 RR 與 ASR
| 指標/條件 | English | zh-TW | Javanese | Burmese | Thai | Vietnamese | Tagalog | Esperanto |
|---|---|---|---|---|---|---|---|---|
| ASR (%) — None | 3.9 | 3.7 | 1.4 | 3.5 | 3.3 | 4.8 | 2.0 | 3.2 |
| ASR (%) — PSA | 1.43 | 1.12 | 0.97 | 1.30 | 1.13 | 0.48 | 0.49 | 1.94 |
| RR (%) — None | 66.51 | 61.21 | 40.65 | 16.40 | 59.74 | 58.76 | 55.68 | 53.37 |
| RR (%) — PSA | 31.00 | 23.50 | 14.00 | 16.29 | 26.00 | 23.80 | 24.50 | 16.86 |
在這組 315 題、八語言、五模型的條件下,PSA 的 RR 和 ASR 都比 None 條件低;因此它不能被解讀成更有效的攻擊。投影片也記錄,部分輸出是在摘要論文,而不是回應 harmful prompt,這是為什麼較低的 RR 不等於成功繞過,也不代表更高的攻擊品質。
能說明什麼,不能說明什麼
這個研究讓我練習的技術能力包括測試條件設計、跨語言提示整理、模型回應評估,以及把安全結論限制在實際測試範圍內。它能說明語言覆蓋、攻擊包裝和判定器是 LLM 安全評估需要明確記錄的變因,也能留下後續重跑和比較的框架。
它不能直接推出所有模型、所有低資源語言都具有相同風險,更不能用一次測試替代部署環境的完整安全評估。模型版本、提示內容、翻譯品質、PSA wrapper、篩選/judge 設定和評估標準都會影響觀察結果;因此這頁不宣稱通用繞過率或單一模型的普遍結論。
我會保留的研究原則
這次我更在意測試條件是否一致、結果是否能被重新檢查,而不是只尋找一個最醒目的 bypass。對 LLM 安全來說,能說清楚「在哪個條件下觀察到什麼」本身就是研究結果的一部分。
完整內容見 AIS3 研究簡報。