大學行政 Chatbot 的 LLM Guardrail 比較:Llama Guard 3 與 GPT OSS Safeguard
一般分享By 李喆
Content
隨著大型語言模型(LLM)逐漸應用於客服、校務與行政 Chatbot,如何透過 Guardrail 防止 Prompt Injection、Jailbreak 與非預期內容,成為生成式 AI 安全的重要議題。本文整理 PAEE 2026 論文《Comparative Evaluation of Llama Guard 3 and GPT OSS Safeguard as LLM Guardrails for a University Administrative Chatbot》,比較 Llama Guard 3 與 GPT OSS Safeguard 在安全性、Precision、Recall、F1、推論速度與部署成本上的差異,並分享閱讀後對 LLM Guardrail、安全性與真實世界測試的心得。
📌 研究重點快速看
Llama Guard 3:Recall 高達 85.5%,速度約 207 ms/sample,適合重視漏判率與即時性的場景。
GPT OSS Safeguard:Precision 達 74.5%,F1 71.7%,威脅分類能力較佳,但推論成本與延遲明顯較高。
真實與合成資料的落差:最值得注意的是 Llama Guard 3 在合成資料 F1 達 98.1%,真人測試卻降至 69.4%,顯示 Guardrail 的實際安全能力不能只依賴合成 Benchmark 判斷。
一、為什麼大學行政 Chatbot 需要 LLM Guardrail?
簡報以大學行政 Chatbot 為應用場景,指出使用者請求可能偏離行政服務用途,也可能透過 Prompt Injection 或 Jailbreak 嘗試繞過限制。研究比較 Llama Guard 3 與 GPT OSS Safeguard,關注的面向包括主題限制、過度拒答、可用性與部署成本。
二、Llama Guard 3 與 GPT OSS Safeguard 的 Guardrail 設定比較
簡報將兩種方法呈現為不同的防護配置:
方法 | 簡報中的設定 |
Llama Guard 3 | 8B 模型,以 LoRA 微調;訓練使用 NF4,基準推論使用 bfloat16 |
GPT OSS Safeguard | 20B reasoning model,不微調模型參數;使用 Safety Policy、few-shot prompting 與 CoT 推理 |
簡報提到,GPT OSS Safeguard 在 zero-shot 初始效果不足,之後加入少量示範案例並調整 Safety Policy。這項比較因此涵蓋模型、訓練與提示設定,不只是兩個模型名稱的直接對照。
三、研究方法與測試資料集
簡報把安全政策分為 15 類:S1–S14 來自 MLCommons Safety Benchmark,另加入 S15「Topic Restriction」,用來判斷內容是否超出大學行政用途。依照這項設定,即使請求內容本身無害,只要偏離行政服務範圍,也可能被判為不允許。
資料部分分為訓練集、合成測試集與 Ground truth 真人測試集:
資料集 | 筆數 | 簡報中的用途或來源 |
Training set | 約 2,800 | 由 PLLuM 8B 生成,用於 LoRA 訓練 |
Synthetic test | 2,929 | 合成資料測試,涵蓋 15 類安全政策 |
Ground truth | 1,802 | 真人紅隊測試,簡報標示由 30 多位學生進行 24 小時測試 |
評估分成 SAFE/UNSAFE 二元分類與威脅類別分類,列出的指標包括 Accuracy、Precision、Recall、F1、FP、FN 與 FPR。簡報也提及模型判斷一致率與 McNemar’s test。
四、Llama Guard 3 vs GPT OSS Safeguard 真人測試結果
在 Ground truth 真人測試集上,簡報報告:
模型 | Recall | Precision | F1 |
Llama Guard 3 | 85.5% | 58.3% | 69.4% |
GPT OSS Safeguard | 69.1% | 74.5% | 71.7% |
簡報以這組結果說明兩種方案的差異:Llama Guard 3 的 Recall 較高,較少漏掉 Unsafe 請求;GPT OSS Safeguard 的 Precision 較高,簡報將其概括為誤擋較少。
五、LLM Guardrail 的合成資料為何與真人測試差距這麼大?
簡報特別比較合成資料與真人資料的結果。Llama Guard 3 的 F1 從合成測試的 98.1% 降到真人測試的 69.4%,相差 28.7 個百分點。簡報指出,模型在合成資料上的表現看來較佳,但面對真人實際輸入時效果明顯不同。
此外,GPT OSS Safeguard 有 92 筆未產生判定,簡報列出的原因是推理長度上限。
六、威脅類別分類能力與不同精度的量化結果
在 S15 Topic Restriction 的分類結果中,簡報列出 GPT OSS Safeguard 整體分類準確率為 74.4%,Llama Guard 3 為 56.7%。其中一項常見混淆是 Llama Guard 3 將 45 筆 S13 Prompt Injection 判為 S15 Topic Restriction。簡報提醒,類別判錯不必然等於 SAFE/UNSAFE 判斷錯誤。
量化方面,簡報比較 Llama Guard 3 不同精度格式:
格式 | Accuracy | F1 | VRAM |
bfloat16 | 69.0% | 69.4% | 15,637 MB |
INT8 | 70.0% | 69.8% | 8,986 MB |
INT4 | 65.6% | 67.5% | 5,759 MB |
簡報指出,INT8 相較 bfloat16 減少 42.5% VRAM,F1 為 69.8%,與 bfloat16 的判斷一致率為 95.8%。
七、推論延遲速度與使用者安全認知回饋
簡報列出的平均分類時間為:
模型 | 每筆平均時間 | Throughput |
Llama Guard 3 | 207 ms | 4.8 samples/s |
GPT OSS Safeguard | 10,575 ms | 0.09 samples/s |
據此,簡報將 Llama Guard 3 描述為約快 51 倍,並提出可由快速模型先篩選,再讓推理模型處理邊界案例的後續方向。
使用者回饋部分,簡報報告專家與使用者的安全判斷一致率為 64.9%,並指出學生整體判斷較保守。這部分將安全分類延伸到使用者體驗與信任議題。
八、結論與後續研究方向
簡報的結論是,沒有單一全面最佳的 Guardrail:Llama Guard 3 的檢出率較高、速度較快;GPT OSS Safeguard 的誤擋較少、分類較細。簡報也提到,開源模型提供本地部署選擇,但目前結果只在單一機構驗證。
後續研究方向包括檢驗多位專家的標註一致性、加入 GCG 與 AutoDAN 等結構化攻擊,以及確認研究結果能否推廣到其他學校與服務情境。
九、論文心得:LLM Guardrail 真正困難的是安全與可用性的平衡
Guardrail(安全護欄)是當前生成式 AI 發展中至關重要的研究課題。正如指導老師所提到的,隨著生成式 AI 普及,如何發揮模型潛能並守住安全底線,已成為很有價值的研究方向。透過這篇論文,我對 Guardrail 有了更深刻的認識:它不只是把危險內容擋掉,更需要在安全性與可用性之間取得平衡。防護過於嚴格,可能誤攔合理請求;防護不足,又可能讓潛在風險進入系統。
閱讀研究結果時,我也注意到合成資料與真人測試之間存在明顯落差。以 Llama Guard 3 為例,F1-score 在合成測試資料集上為 98.1%,在真人測試中則降至 69.4%,相差 28.7 個百分點。這項差距讓我和學長姐對研究數據的嚴謹性,以及合成資料能否代表真實使用情境產生疑問。合成測試上的高分,未必能反映模型面對真人輸入時的表現,因此解讀這些結果時仍須審慎。
這篇論文也讓我注意到,「安全」並非完全客觀、固定的標準。簡報指出,領域專家與一般使用者對 SAFE 或 UNSAFE 的判斷一致率為 64.9%,顯示不同背景的人對安全邊界可能有不同理解。因此,評估 Guardrail 除了看 Accuracy、Precision、Recall 或 F1 等分類指標,也需要考慮使用者體驗與對系統的信任。
在 AI 資訊生成成本大幅降低的時代,安全與可信任性愈來愈重要。資訊能快速產生與傳播,但分辨哪些內容真實、哪些內容不可靠,卻不容易。這次閱讀讓我把思考從「AI 能不能完成任務」,延伸到「AI 應不應該執行這項任務,以及在什麼條件下才能執行」。AI 系統追求能力與效率的同時,也需要安全機制來限制、檢查並修正模型行為;如何建立可靠的機制,仍有許多值得深入研究的地方。