Llama Guard 3 je předtrénovaný model Llama-3.1-8B, doladěný pro klasifikaci bezpečnosti obsahu. Podobně jako předchozí verze, může být použit ke klasifikaci obsahu jak ve vstupech LLM (klasifikace promptu), tak v odpovědích LLM (klasifikace odpovědi). Funguje jako LLM – generuje text ve svém výstupu, který indikuje, zda je daný prompt nebo odpověď bezpečný nebo nebezpečný, a pokud je nebezpečný, také vypisuje kategorie obsahu, které byly porušeny.
Llama Guard 3 byl sladěn tak, aby chránil proti standardizované taxonomii rizik MLCommons a byl navržen tak, aby podporoval schopnosti Llama 3.1. Konkrétně poskytuje moderování obsahu v 8 jazycích a byl optimalizován pro podporu bezpečnosti a zabezpečení pro vyhledávání a volání nástrojů interpretu kódu.