如果一个模型在没有任何解释的情况下拒绝贷款,那么它就难以让人信任,也更难被质疑。可解释人工智能开发出一些方法,使模型的决策能够被人类理解,例如通过更简单的替代模型、特征归因或可视化解释。
研究方法可分为两大类。局部方法解释单个预测结果,例如 SHAP 值或 LIME 值。全局方法描述模型的整体行为,例如特征重要性排序或从复杂模型中提取的决策规则。
常用技巧
- 特征归因的 SHAP 值
- LIME 用于局部代理模型
- 图像模型的显著性图
- 文本注意力可视化
- 反事实解释
解释可能会误导人。显著性图可能突出显示与预测相关的像素,但却无法揭示模型的实际推理过程。监管机构越来越要求在高风险领域提供可解释性,但该领域对于何为好的解释尚无统一标准。
Comments
No comments yet. Be the first to share a thought.
Leave a comment