ProgramGen Inference Monitor

GLM-5.3-Flash-FP8 · run1 + run2

连接中

实时作业状态

正在读取指标

等待首个数据快照

Job进度完成错误最近活动

健康判定

健康分扣分规则

评分口径

Reward 统计规则

服务效率

推理 API 与 GPU

网关检查中
节点GPU 利用率显存KV cache运行 / 排队生成速度Prefix hitTPOT

GPU 与 KV cache

百分比,节点平均值

吞吐与缓存效率

生成 token/s · Prefix cache hit

失败请求

API 错误码与次数

上游码HTTP 状态类型错误摘要过去 2 小时过去 24 小时总量

可复现性

完整推理配置

输出轨迹

轨迹统计与明细

输入类型已处理 instances可用轨迹样本耗时 P50步数 P50Reasoning P50输出 P50Reward 均值 ± 标准差

任务Run输入状态耗时步数输入 tokens输出 tokensReasoningReward结束/确认时间