龙云宗主^__^ 发表于 2026-9-1 09:12

AI安全治理新动态

Anthropic公开的自动化对齐研究员系统可自主修复AI大模型自身的安全漏洞,能处理越狱、提示注入、幻觉等10类常见AI安全问题,修复效率平均6小时可追平28名人类安全研究者的工作成果,为AI软件安全治理提供了新的技术路径。
页: [1]
查看完整版本: AI安全治理新动态