Anthropic 提出新模型安全系統,能成功擋下 95% 越獄嘗試

署名 INSIDE 硬塞的網路趨勢觀察

Anthropic 目前不會將新系統馬上運用在 Claude 模型上,但如果未來有風險更高的模型發布,則會考慮將新系統用在安全防護上。...