AI安全对齐技术动态:价值观对齐与风险控制新进展 大模型安全对齐技术持续演进,DPO和宪法AI等新方法正降低对人工标注的依赖。国内已建立安全评估标准与红队测试机制。本文解析对齐技术路线、可解释性研究进展及产业落地实践。 AI安全对齐RLHFDPO 2026-07-09👁 23查看