AI 管理控制台
AI 堆栈配备了一个管理控制台。您可以在浏览器中无需登录服务器,直接查看 GPU 的忙碌程度、LLM 是否出现性能下降、文档索引是否正常运行。
本文档面向首次打开控制台的用户。请先按照 10 分钟导览 依次操作,然后在需要时查阅各屏幕的详细说明。
现场运维人员和系统管理员使用。控制台主要是查看界面,误操作很难导致严重后果。涉及修改数值的地方仅有三处:文档上传、删除和特征回填,文档中已单独标注。
访问和登录
地址因安装方式而异,有两种。请向管理员确认是哪一种。
| 安装方式 | 地址 |
|---|---|
| 带域名的安装 | https://admin.<COMPANY_DOMAIN> |
| 内网 IP 访问 | http://<AI_SERVER_IP>:9080 |
在登录屏幕输入用户名和密码。默认用户名为 admin,密码由安装时的管理员设定。
控制台不设置按用户的账户。整个运维团队共用一个账户登入。由于无法区分谁看过什么内容,请妥善管理密码,防止外泄。
8 小时后需要重新登录。浏览历史会被保留,登录后会回到原来的页面。重启服务时可能导致全体登出 — 如果会话频繁断开,请参考 会话断开问题。
控制台的菜单和按钮以英文显示(仅主页的服务卡片描述用韩文显示)。下文中,实际显示在屏幕上的英文名称用粗体标记,并附上中文含义。
10 分钟导览
首次使用者请按此顺序浏览一遍。仅查看,不做任何修改。
第 1 步 — 登录并查看主页
登录后会直接显示主页。最上方有一行状态摘要。
정상 12 주의 0 중단 0 합계 12
这一行数字就是 AI 堆栈整体健康状态的全部内容。如果 중단 是 0,基本上可以放心。数字每 20 秒自动刷新一次,无需手动刷新。
点击摘要行右侧的展开箭头,会显示各服务的具体状态列表。一旦展开,下次进入时仍会保持展开状态。
在列表中将鼠标悬停在那项服务上,工具提示中会显示黄灯的原因。例如,服务本身正常但数据库连接断开时会在这里被捕获。
第 2 步 — 浏览服务卡片
摘要行下方排列着服务卡片。每张卡片代表一项服务。
- 边框颜色和状态指示点表示是否正常
- 点击进入该服务的屏幕
- 有些卡片无法点击 — 这些是浏览器无法直接访问的内部服务。可理解为仅用于查看状态的卡片
第 3 步 — 查看 GPU
在左侧竖条(侧栏)中点击 GPU。会显示 GPU 设备表格。
| 查看项 | 含义 |
|---|---|
| 使用率 | 当前 GPU 的繁忙程度 |
| 内存 | 模型占用的内存量 |
| 温度 | 温度过高会导致性能下降 |
| XID | NVIDIA 硬件或驱动错误计数 |
XID 是 GPU 硬件或驱动产生的错误。如不重视,下一步通常就是服务器崩溃。如果看到非 0 的数值,请记录该值并告知系统管理员。
第 4 步 — 查看 LLM 响应速度
在侧栏中点击 LLM。会按模型显示相应速度和吞吐量。
当收到"最近回复变慢"的反馈时,查看 P95(响应时间较慢的 100 条请求中排名第 5 的)列。如果相比平时明显升高,说明用户的反馈确实成立。行末的小折线图显示最近的趋势。
第 5 步 — 进入某个服务查看
在侧栏中点击 RAG API。左侧会展开该服务的菜单。 点击 Documents(文档)。会显示已索引的文档列表。
此步仅查看已索引多少份文档,不要点击其他内容。当聊天机器人回答"未找到相关文档"时,这里是首先要检查的地方。
第 6 步 — 查看日志
在同一服务菜单中点击 Logs(日志)。最近的日志会以最新优先显示。无需通过 SSH 登入服务器执行 docker logs。
第 7 步 — 完成
完成这些步骤后,您已经掌握了控制台 90% 的功能。总结如下:
从主页查看整体状态 → 进入异常的服务 → 查看日志。
其他屏幕在需要时参考下文的说明。
屏幕地图
左侧侧栏(始终可见)
| 菜单 | 功能 |
|---|---|
| Home | 整体状态摘要 + 服务卡片 |
| GPU | GPU 设备的使用率、内存、温度、XID |
| LLM | 按模型的响应速度、吞吐量 |
| RAG API | 文档搜索引擎 — 索引、同步、搜索测试 |
| Timeseries Insight | 设备数据异常检测与预测引擎 |
| Document Parsing | 从文档中提取表格、字段的服务 |
| Vision | 图像判读服务(不良品判定、仪表读取) |
| Operations Manual ↗ | 本操作说明文档(新窗口打开) |
GPU 和 LLM 在其他服务的上方显示并非偶然。性能下降或服务宕机通常源于下层基础设施,因此从上到下依次检查能更快地定位问题。
Operations Manual 链接指向外部站点(docs.plantpulse.io)。在无互联网访问的现场会无法打开。操作说明文档副本已随服务器一起安装,如需访问请联系管理员。
四项服务共有的菜单
RAG API、Timeseries Insight、Document Parsing、Vision 拥有以下四个完全相同的菜单。学会一次即可用于四处。
| 菜单 | 功能 |
|---|---|
| MCP Server Info | 该服务向 AI 副驾驶提供的工具列表 |
| API Endpoints | 该服务提供的 API 列表(供集成开发者使用) |
| Logs | 最近日志(最新在最上方) |
| Settings | 当前应用的配置值 — 仅供查看 |
仅显示值,无法修改。密码、API 密钥会被隐蔽处理显示。要实际修改配置,请参考 密码、API 密钥变更 和 服务运维。
RAG API — 文档搜索
该服务使聊天机器人能基于公司文档作答。收到"聊天机器人找不到文档"的反馈时,从这里开始排查。
| 菜单 | 功能 |
|---|---|
| Documents | 已索引文档列表。支持上传、删除 |
| Sync History | 同步运行历史和成功/失败记录 |
| Query Test | 输入搜索词直接测试搜索结果 |
| 通用 4 项 | 参考 上表 |
聊天机器人找不到文档时
- 在 Documents 中检查该文档是否在列表中 — 不在说明未被索引
- 如果在,在 Query Test 中用类似用户提问的方式搜索
- 仍然无结果,尝试更换搜索方式 — 可在
hybrid、local、global、naive、mix中选择。默认为hybrid - 在 Sync History 中检查最后一次同步是否以失败结束
已删除的文档聊天机器人将无法使用作为根据。要再次使用,必须重新上传原始文件。如果没有原始文件副本,请勿删除。
Timeseries Insight — 异常检测与预测
从设备数据中发现异常征兆并预测未来趋势的引擎。菜单最多的服务。
分析屏幕
按对象,异常检测(Anomaly Detection) 和预测(Forecast) 成对出现。
| 分组 | 屏幕 |
|---|---|
| Asset(设备) | Anomaly Detection · Forecast · Health Index(设备健康评分) |
| Production(生产) | Anomaly Detection · Quality Forecast(品质预测) |
| Alarm(报警) | Frequency Anomaly(发生频率异常) · Failure Forecast(故障预测) · Duration Analysis(持续时间分析) · Sensor Correlation(传感器相关性) · Statistics(统计) |
| System(系统) | Anomaly Detection · Forecast |
| Profiling | Asset Profiling — 深入查看单个设备 |
Feature Store — 分析的素材
上述分析依赖 Feature Store 中积累的加工数据。如分析结果为空或数据陈旧,通常源于此处。
| 菜单 | 功能 |
|---|---|
| Pipeline Status | 数据加工是否正常运行 |
| Run History | 过去的执行记录和成功/失败状态 |
| Feature Data | 查看实际积累的数值 |
| Backfill | 重新填充缺失的时间段 |
这是重新计算历史时间段的操作,范围越广耗时越长,服务器负载越高。请在生产空闲时段进行,仅处理必要的时间范围。如是第一次操作,建议与管理员协商。
Document Parsing · Vision
两项服务仅具有 通用的四个菜单。在控制台中的作用是检查服务是否正常运行,发生问题时查看日志。
- Document Parsing — 从文档中提取版面、表格、字段
- Vision — 通过图像判定不良品或读取仪表
两者都是浏览器无法直接访问的内部服务,因此主页卡片也无法点击。控制台代为查询其状态并显示。
常见问题速查
| 现象 | 首先查看 | 然后 |
|---|---|---|
| 聊天机器人找不到文档 | RAG API → Documents | 用 Query Test 直接搜索 → 查看 Sync History |
| 聊天机器人回复变慢 | LLM 中的 P95 | GPU 使用率、温度 |
| 分析结果为空 | Insight → Pipeline Status | 查看 Run History 中的失败项 |
| 主页出现黄灯 | 展开状态列表查看工具提示 | 进入相应服务 → Logs |
| 主页出现红灯 | 进入相应服务 → Logs | 参考 服务运维 中的重启步骤 |
| 屏幕空白且显示错误条 | 该服务可能尚未启动 | 在主页检查状态 |
控制台在无法获取数据时会显示错误条,而不是伪装成空表。若出现错误条,说明不是没有数据,而是连接出现问题。
账户与会话
控制台账户通过环境变量而非数据库管理。
| 环境变量 | 含义 | 默认值 |
|---|---|---|
ADMIN_AUTH_USERNAME | 登录用户名 | admin |
ADMIN_AUTH_PASSWORD | 登录密码 | 无 — 必须指定 |
ADMIN_SESSION_SECRET | 会话签名密钥 | 空则每次启动时重新生成 |
ADMIN_SESSION_MAX_AGE | 登录保持时间(分钟) | 480(8 小时) |
若 ADMIN_AUTH_PASSWORD 为空,控制台拒绝启动。这是为了防止无认证的管理门户悄悄开放,属正常行为。
若 ADMIN_SESSION_SECRET 为空,每次重启服务时都会生成新的签名密钥,导致全体用户登出。指定此值可保证重启后会话保留。
bin/passwd.sh 修改控制台账户不在 bin/passwd.sh 管理的密钥列表中(参考 密码、API 密钥变更 的表格)。
修改密码需直接编辑环境文件并重启服务。请向管理员请求。
相关文档
- 服务端口映射 — 控制台地址及各服务监听端口
- 服务运维 — 启动、停止、重启步骤
- 密码、API 密钥变更 — 密钥轮换
- 日志及监控 — 从服务器直接查看日志