抽象的:
- HiddenLayer 的研究人員開發了一種針對大型語言模型 (LLM) 的新攻擊,稱為 TokenBreaker。
- 只需添加或更改一個字符,他們就可以繞過一些安全機制。
- 基本的大型語言模型(LLM)仍然能夠理解攻擊的意圖。
安全研究人員發現了一種繞過某些內建保護機制的方法 大型語言模型 (法學碩士)並使其對惡意索賠作出回應。
HiddenLayer 的 Kieran Evans、Casimir Schulz 和 Kenneth Young 發表了一篇關於他們稱為 TokenBreak 的新攻擊技術的深入報告,該技術針對的是一些大型語言模型 (LLM) 將文本分解為標記的方式,特別是那些使用字節對編碼 (BPE) 或 WordPiece 策略的模型。

標記化是將文字分解成更小的單元(稱為標記)的過程,這些單元可以是單字、單字的一部分或字符,大型語言模型 (LLM) 會利用這些標記來理解和產生語言。例如,“unhappiness”這個詞可以分解成“un”、“happi”和“ness”,然後每個標記都會被轉換成模型可以處理的數字標識符(因為 LLM 讀取的不是原始文本,而是數字)。這種攻擊構成了日益嚴重的網路安全威脅,需要組織和研究人員制定先進的防禦策略來保護他們的人工智慧系統。
什麼是 finstructions?
Finstructions 依賴在關鍵字中添加額外的字元(例如將“instructions”變成“finstructions”),從而允許攻擊者欺騙安全模型,使其相信程式碼是無害的。
相較之下,目標大型語言模型(LLM)仍然能夠理解指令的原始意圖,使攻擊者能夠將惡意程式碼繞過防禦機製而不被發現。此漏洞對人工智慧系統構成了重大的安全風險。
這項技術可用於繞過人工智慧垃圾郵件過濾器,並將惡意內容傳送到人們的收件匣,從而增加網路釣魚和惡意軟體攻擊的風險。
例如,如果垃圾郵件過濾器被訓練來封鎖包含「彩票」一詞的郵件,它可能會允許「你中了彩票!」這樣的郵件通過,從而使收件人暴露於潛在的惡意登錄頁面、惡意軟體感染等風險。這種語言操縱可以繞過安全機制。
研究人員解釋說:“這種攻擊技術以一種導致某些模型給出錯誤分類的方式操縱輸入文字。”
他們補充說:“更重要的是,最終目標(大型語言模型或電子郵件收件人)仍然可以理解和響應被操縱的文本,因此容易受到保護模型專門設計用來防止的攻擊。”
HiddenLayer 補充道,使用 Unigram 分詞器的模型能夠抵禦此類操縱。因此,一種緩解策略是選擇具有更穩健的分詞方法的模型。










