模型监控主要看哪些指标

wen IT资讯 2

本文目录导读:

模型监控主要看哪些指标

  1. 场景一:传统机器学习模型(上线后/生产环境)
  2. 场景二:大语言模型(LLM)应用
  3. 场景三:模型训练过程中的监控
  4. 核心优先级

模型监控的指标选择,取决于你监控的对象机器学习模型还是大语言模型(LLM),以及监控的阶段(训练中 vs 上线后)。

我们可以分三个场景来看:

传统机器学习模型(上线后/生产环境)

这是最经典的数据科学监控场景,核心关注数据漂移模型衰退

数据质量与输入监控

  • 特征缺失率:输入特征的空值比例是否突然升高。
  • 特征分布漂移:使用 PSI(群体稳定性指数)或 KS 检验,判断特征的分布是否与训练时一致(例如用户年龄分布突然偏移)。
  • 业务逻辑校验:输入值是否符合业务规则(如年龄>0,金额>0)。

预测性能监控

  • 准确率/精确率/召回率/F1:如果有实时反馈标签,这是最直接的。
  • AUC / LogLoss:用于概率预测模型的排名和校准能力。
  • 残差分析:预测值与实际值的误差是否变大,是否有系统性偏差。

业务与运行监控

  • 预测分布:模型预测的正负样本比例是否剧烈变化(例如贷款通过率突然从30%飙升到80%)。
  • 模型延迟与吞吐量:API响应时间(P99)和每秒请求量。
  • 模型新鲜度:模型上次训练时间距今多久(数据过期程度)。

大语言模型(LLM)应用

LLM监控不仅看技术指标,还要看安全性用户体验,通常使用“RAG”或“Agent”架构时需分层监控。

质量与准确性

  • 答案相关性(Answer Relevance):回答是否切题。
  • 上下文相关性(Context Relevance):检索到的文档是否与问题相关(用于RAG系统)。
  • 忠实度/幻觉率(Groundedness):回答是否有依据,是否编造事实。
  • 语义相似度:输出与期望输出的余弦相似度。

安全与合规

  • PII泄漏检测:模型是否在回答中泄露了身份证、手机号等个人信息。
  • 阻断率:涉及暴力、歧视、违法等内容的拦截比例。
  • 提示注入攻击率:检测恶意Prompt试图绕过限制的比例。

成本与性能

  • Token消耗:单次请求的平均Token数,直接关联费用。
  • 首Token延迟(TTFT):用户等待第一个字出现的时间。
  • 响应中断率:流式输出中途断开的比例。

业务闭环指标(最难但最重要)

  • 用户采纳率:用户是否复制了生成的答案,或是否点击了“点赞/点踩”。
  • 任务完成率:在Agent场景下,AI是否成功帮用户完成了多步任务。

模型训练过程中的监控

如果你在调参或训练,关注的是收敛性过拟合

  • 损失函数(Loss):训练集和验证集的Loss曲线是否同步下降。
  • 梯度范数:梯度是否消失(趋近于0)或爆炸(突然巨大)。
  • 学习率:当前学习率的实时状态。
  • 过拟合差距:训练集的准确率与验证集的准确率差距是否过大。

核心优先级

如果你时间有限,建议优先关注以下三个“生死攸关”的指标:

  1. 数据漂移(PSI):线上数据变了,模型大概率会失效。
  2. 业务关键指标(如转化率/AUC):模型是否还在挣钱/解决问题。
  3. 可用性(SLO/延迟):模型是否还在正常服务(宕机一切免谈)。

补充一个技巧:监控不是只看数字,关键是设置动态阈值报警机制,一旦指标突破了历史波动范围(如PSI>0.25),就需要触发告警并触发模型重训。

抱歉,评论功能暂时关闭!