首次运行检查

模型网关环境检测

需要 NVIDIA 驱动、CUDA 运行环境和 llama.cpp 可执行入口全部通过后,才能进入控制台注册并推理 GGUF 模型。

正在检测当前机器环境。
1. NVIDIA 驱动 / CUDA 缺失时先执行,完成后重启
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt update
sudo apt install -y nvidia-open cuda-toolkit
echo 'export PATH=/usr/local/cuda/bin:$PATH' >> ~/.bashrc
sudo reboot
2. llama.cpp GPU 版本 驱动和 CUDA 正常后再执行
git clone https://gitee.com/a1664573841/llama.cpp  # gitee
cd llama.cpp
cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON
cmake --build build -j$(nproc)

sudo cmake --install build

echo 'export LD_LIBRARY_PATH=/usr/local/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc
source ~/.bashrc

运行时统一模型推理服务

统一管理 LLM、Embedding、多模态和 ASR 模型的加载、推理与运行状态。

状态:空闲

服务总览

等待刷新

模式 检查中 模型 0 已加载 0
当前请求 0 活动 0 / 排队 0
近 1 小时请求 0 成功 0 / 失败 0
成功率 0% 平均响应 0 ms
当前模型 - 未加载
显存占用 检查中 推理进程占用 0 MB
Token 计算
0 输入 0 / 输出 0

过程状态

等待队列 0 个

执行队列 0 个

完成队列 0 个

实时请求追踪

0 个请求
请求状态 请求问题 模型 过程 加载 推理 结果
当前没有正在处理或排队的请求。
运行统计与告警

近 1 小时

请求质量

模型排行

请求量

调用方排行

来源

生产告警

未配置

历史调用

0 条
时间 调用方 请求问题 模型 状态 排队 加载 推理 Token 总耗时 操作
暂无历史调用。

模型服务管理

尚未刷新

模型 类型 状态 运行信息 操作
暂无模型。

模型接入

权限检查 模型在用户目录时,先确认服务用户能读取文件。
填写 GGUF 路径后生成授权命令。
诊断工作台

GPU 状态

运行时

服务事件

类型 模型 耗时 摘要
暂无服务事件。

服务日志

最近 100 条服务日志。