跳至主要內容
返回部落格

大學行政 Chatbot 的 LLM Guardrail 比較:Llama Guard 3 與 GPT OSS Safeguard

一般分享

作者:李喆

內文:

  • 隨著大型語言模型(LLM)逐漸應用於客服、校務與行政 Chatbot,如何透過 Guardrail 防止 Prompt Injection、Jailbreak 與非預期內容,成為生成式 AI 安全的重要議題。本文整理 PAEE 2026 論文《Comparative Evaluation of Llama Guard 3 and GPT OSS Safeguard as LLM Guardrails for a University Administrative Chatbot》,比較 Llama Guard 3 與 GPT OSS Safeguard 在安全性、Precision、Recall、F1、推論速度與部署成本上的差異,並分享閱讀後對 LLM Guardrail、安全性與真實世界測試的心得。

📌 研究重點快速看

  • Llama Guard 3:Recall 高達 85.5%,速度約 207 ms/sample,適合重視漏判率與即時性的場景。

  • GPT OSS Safeguard:Precision 達 74.5%,F1 71.7%,威脅分類能力較佳,但推論成本與延遲明顯較高。

  • 真實與合成資料的落差:最值得注意的是 Llama Guard 3 在合成資料 F1 達 98.1%,真人測試卻降至 69.4%,顯示 Guardrail 的實際安全能力不能只依賴合成 Benchmark 判斷。

一、為什麼大學行政 Chatbot 需要 LLM Guardrail?

簡報以大學行政 Chatbot 為應用場景,指出使用者請求可能偏離行政服務用途,也可能透過 Prompt Injection 或 Jailbreak 嘗試繞過限制。研究比較 Llama Guard 3 與 GPT OSS Safeguard,關注的面向包括主題限制、過度拒答、可用性與部署成本。


二、Llama Guard 3 與 GPT OSS Safeguard 的 Guardrail 設定比較

簡報將兩種方法呈現為不同的防護配置:


方法

簡報中的設定

Llama Guard 3

8B 模型,以 LoRA 微調;訓練使用 NF4,基準推論使用 bfloat16

GPT OSS Safeguard

20B reasoning model,不微調模型參數;使用 Safety Policy、few-shot prompting 與 CoT 推理

簡報提到,GPT OSS Safeguard 在 zero-shot 初始效果不足,之後加入少量示範案例並調整 Safety Policy。這項比較因此涵蓋模型、訓練與提示設定,不只是兩個模型名稱的直接對照。


三、研究方法與測試資料集

簡報把安全政策分為 15 類:S1–S14 來自 MLCommons Safety Benchmark,另加入 S15「Topic Restriction」,用來判斷內容是否超出大學行政用途。依照這項設定,即使請求內容本身無害,只要偏離行政服務範圍,也可能被判為不允許。


資料部分分為訓練集、合成測試集與 Ground truth 真人測試集:


資料集

筆數

簡報中的用途或來源

Training set

約 2,800

由 PLLuM 8B 生成,用於 LoRA 訓練

Synthetic test

2,929

合成資料測試,涵蓋 15 類安全政策

Ground truth

1,802

真人紅隊測試,簡報標示由 30 多位學生進行 24 小時測試

評估分成 SAFE/UNSAFE 二元分類與威脅類別分類,列出的指標包括 Accuracy、Precision、Recall、F1、FP、FN 與 FPR。簡報也提及模型判斷一致率與 McNemar’s test。


四、Llama Guard 3 vs GPT OSS Safeguard 真人測試結果

在 Ground truth 真人測試集上,簡報報告:


模型

Recall

Precision

F1

Llama Guard 3

85.5%

58.3%

69.4%

GPT OSS Safeguard

69.1%

74.5%

71.7%

簡報以這組結果說明兩種方案的差異:Llama Guard 3 的 Recall 較高,較少漏掉 Unsafe 請求;GPT OSS Safeguard 的 Precision 較高,簡報將其概括為誤擋較少。


五、LLM Guardrail 的合成資料為何與真人測試差距這麼大?

簡報特別比較合成資料與真人資料的結果。Llama Guard 3 的 F1 從合成測試的 98.1% 降到真人測試的 69.4%,相差 28.7 個百分點。簡報指出,模型在合成資料上的表現看來較佳,但面對真人實際輸入時效果明顯不同。

此外,GPT OSS Safeguard 有 92 筆未產生判定,簡報列出的原因是推理長度上限。


六、威脅類別分類能力與不同精度的量化結果

在 S15 Topic Restriction 的分類結果中,簡報列出 GPT OSS Safeguard 整體分類準確率為 74.4%,Llama Guard 3 為 56.7%。其中一項常見混淆是 Llama Guard 3 將 45 筆 S13 Prompt Injection 判為 S15 Topic Restriction。簡報提醒,類別判錯不必然等於 SAFE/UNSAFE 判斷錯誤。


量化方面,簡報比較 Llama Guard 3 不同精度格式:


格式

Accuracy

F1

VRAM

bfloat16

69.0%

69.4%

15,637 MB

INT8

70.0%

69.8%

8,986 MB

INT4

65.6%

67.5%

5,759 MB

簡報指出,INT8 相較 bfloat16 減少 42.5% VRAM,F1 為 69.8%,與 bfloat16 的判斷一致率為 95.8%。


七、推論延遲速度與使用者安全認知回饋

簡報列出的平均分類時間為:


模型

每筆平均時間

Throughput

Llama Guard 3

207 ms

4.8 samples/s

GPT OSS Safeguard

10,575 ms

0.09 samples/s

據此,簡報將 Llama Guard 3 描述為約快 51 倍,並提出可由快速模型先篩選,再讓推理模型處理邊界案例的後續方向。

使用者回饋部分,簡報報告專家與使用者的安全判斷一致率為 64.9%,並指出學生整體判斷較保守。這部分將安全分類延伸到使用者體驗與信任議題。


八、結論與後續研究方向

簡報的結論是,沒有單一全面最佳的 Guardrail:Llama Guard 3 的檢出率較高、速度較快;GPT OSS Safeguard 的誤擋較少、分類較細。簡報也提到,開源模型提供本地部署選擇,但目前結果只在單一機構驗證。

後續研究方向包括檢驗多位專家的標註一致性、加入 GCG 與 AutoDAN 等結構化攻擊,以及確認研究結果能否推廣到其他學校與服務情境。


九、論文心得:LLM Guardrail 真正困難的是安全與可用性的平衡

Guardrail(安全護欄)是當前生成式 AI 發展中至關重要的研究課題。正如指導老師所提到的,隨著生成式 AI 普及,如何發揮模型潛能並守住安全底線,已成為很有價值的研究方向。透過這篇論文,我對 Guardrail 有了更深刻的認識:它不只是把危險內容擋掉,更需要在安全性與可用性之間取得平衡。防護過於嚴格,可能誤攔合理請求;防護不足,又可能讓潛在風險進入系統。

閱讀研究結果時,我也注意到合成資料與真人測試之間存在明顯落差。以 Llama Guard 3 為例,F1-score 在合成測試資料集上為 98.1%,在真人測試中則降至 69.4%,相差 28.7 個百分點。這項差距讓我和學長姐對研究數據的嚴謹性,以及合成資料能否代表真實使用情境產生疑問。合成測試上的高分,未必能反映模型面對真人輸入時的表現,因此解讀這些結果時仍須審慎。

這篇論文也讓我注意到,「安全」並非完全客觀、固定的標準。簡報指出,領域專家與一般使用者對 SAFE 或 UNSAFE 的判斷一致率為 64.9%,顯示不同背景的人對安全邊界可能有不同理解。因此,評估 Guardrail 除了看 Accuracy、Precision、Recall 或 F1 等分類指標,也需要考慮使用者體驗與對系統的信任。

在 AI 資訊生成成本大幅降低的時代,安全與可信任性愈來愈重要。資訊能快速產生與傳播,但分辨哪些內容真實、哪些內容不可靠,卻不容易。這次閱讀讓我把思考從「AI 能不能完成任務」,延伸到「AI 應不應該執行這項任務,以及在什麼條件下才能執行」。AI 系統追求能力與效率的同時,也需要安全機制來限制、檢查並修正模型行為;如何建立可靠的機制,仍有許多值得深入研究的地方。

參考論文

https://doi.org/10.48550/arXiv.2510.19169(於新分頁開啟)