首次运行检查

环境检测

NVIDIA、CUDA、llama-server 全部通过后进入控制台。

正在检测当前机器环境。
1. NVIDIA 驱动 / CUDA 缺失时先安装,完成后重启
CUDA_REPO=https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64
wget ${CUDA_REPO}/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt update
sudo apt install -y nvidia-open cuda-toolkit
echo 'export PATH=/usr/local/cuda/bin:$PATH' >> ~/.bashrc
sudo reboot
2. llama.cpp GPU 版本 驱动和 CUDA 正常后执行
git clone https://gitee.com/a1664573841/llama.cpp  # gitee
# 或: git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DLLAMA_BUILD_UI=OFF
cmake --build build -j$(nproc)
sudo cmake --install build
echo 'export LD_LIBRARY_PATH=/usr/local/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc
source ~/.bashrc

统一模型推理服务

v-

管理 GGUF 模型接入、加载、推理、队列和服务状态。

状态:空闲

服务总览

等待刷新

模式 检查中 模型 0 已加载 0
当前请求 0 活动 0 / 排队 0
近 1 小时请求 0 成功 0 / 失败 0
成功率 0% 平均响应 0 ms
当前模型 - 未加载
显存占用 检查中 推理进程占用 0 MB
Token 计算
0 输入 0 / 输出 0

任务队列

等待 0 个

执行 0 个

完成 0 个

实时请求

0 个请求
请求状态 请求问题 模型 过程 加载 推理 结果
暂无请求。
运行统计与告警

近 1 小时

请求质量

模型排行

请求量

调用方排行

来源

生产告警

未配置

历史调用

0 条
时间 调用方 请求问题 模型 状态 排队 加载 推理 Token 总耗时 操作
暂无历史调用。

模型服务管理

尚未刷新

模型 类型 状态 运行信息 操作
暂无模型。

模型接入

权限 拖入或填写路径后自动授权。
填写路径后生成授权命令。
服务日志

GPU 状态

运行时

服务事件

类型 模型 耗时 摘要
暂无服务事件。

服务日志

最近 100 条服务日志。