AI Safety & Governance
8/3/26About 1 min
AI Safety & Governance
AI safety 不是模型外的一层过滤器,而是贯穿 specification、data、training、evaluation、deployment 和 incident response 的系统属性。风险取决于 capability、access、context 和 potential impact。
Risk Management
Map the risk. Limit authority. Measure behavior. Preserve recovery.
从资产和使用场景建立 threat model;让模型能力与实际权限分离; 用分层 evaluation 和生产监控识别风险;为高影响动作保留审批、审计和恢复路径。
TrustworthinessSecurityPrivacyAgentsGovernance
Knowledge Map
Risk discovery
Threat Modeling
资产、行为、攻击者、trust boundary、failure mode 和 impact。
Action safetyAgent Security
Prompt injection、tool authority、data flow、approval 和 sandbox。
Lifecycle controlGovernance
Ownership、documentation、release gates、monitoring、incident 和 retirement。
Risk Surfaces
| Surface | Example risk |
|---|---|
| Data | privacy、consent、provenance、bias、poisoning |
| Model | hallucination、unsafe content、memorization、capability misuse |
| Application | misleading UX、automation bias、bad fallback、overtrust |
| Agent | prompt injection、excess authority、irreversible side effect |
| Infrastructure | model theft、secret exposure、supply chain、denial of service |
| Society / organization | discrimination、misinformation、concentration、accountability gap |
Control Hierarchy
- Avoid:不在高风险场景使用能力,或缩小 scope。
- Prevent:data control、least privilege、input validation、policy。
- Detect:evaluation、monitoring、audit、red team。
- Contain:sandbox、rate limit、approval、blast-radius isolation。
- Recover:rollback、revoke、delete、notify、repair。
