ProgramGen Inference Monitor

GLM-5.3-Flash-FP8 · run1 + run2

连接中

实时作业状态

正在读取指标

等待首个数据快照

Job进度完成错误最近活动

服务效率

推理 API 与 GPU

网关检查中
节点GPU 利用率显存KV cache运行 / 排队生成速度Prefix hitTPOT

GPU 与 KV cache

百分比,节点平均值

吞吐与缓存效率

生成 token/s · Prefix cache hit

输出轨迹

轨迹统计与明细

输入类型轨迹数耗时 P50 / P90步数 P50 / P90Reasoning P50 / P90输出 P50 / P90Reward 均值
任务Run输入状态耗时步数输入 tokens输出 tokensReasoningReward结束时间

可复现性

完整推理配置