给 AI 基础设施巡检脚本加上只读、退出码和审计
巡检脚本最怕两件事:只打印一堆“看起来不对”的文本,或在判断不充分时直接改资源。先把检查和处置拆开,脚本才适合接入日常运维。
输出要能被程序消费
每个检查项应包含对象、观察值、判定依据和时间。正常、发现问题、检查失败使用不同退出码;权限不足、接口超时与确实异常也要分开。涉及请求内容或凭证时,只记录必要的脱敏摘要。
第一阶段默认只读,可检查模型副本未就绪、任务队列积压、证书临近到期、配置漂移和异常重启。阈值从配置读取,并标明负责人,文章不替具体环境虚设数值。
修复动作单独授权
自动处置需要显式参数、幂等键、影响范围和审计记录。删除 Pod、切换流量或修改副本数之前,再读取一次目标状态,避免基于过期结果操作。
脚本验收不只看成功路径。还要模拟 API 不可用、返回字段缺失、重复执行和中途取消,确认退出码稳定,且失败不会留下半完成变更。这样的巡检才是真正能托底的基础设施工具。

572

被折叠的 条评论
为什么被折叠?



