CLI 命令参考
CSGLite 提供了丰富的命令行工具,方便用户在终端直接管理和运行大语言模型。模型名称通常遵循 命名空间/模型名称 的格式,例如 Qwen/Qwen3-0.6B-GGUF。
命令总览
| 分类 | 命令 | 说明 |
|---|---|---|
| 模型运行 | csghub-lite run <model> | 自动下载模型并启动交互式对话(全自动) |
csghub-lite chat <model> | 与已下载的本地模型进行交互对话(支持自定义系统提示词) | |
csghub-lite serve | 启动 REST API 服务,提供 Ollama/OpenAI 兼容接口 | |
| 模型管理 | csghub-lite pull <model> | 从 CSGHub 平台下载模型 |
csghub-lite list 或 ls | 列出所有本地已下载的模型 | |
csghub-lite show <model> | 显示指定模型的详细信息(文件结构、格式、大小) | |
csghub-lite rm <model> | 从本地磁盘删除指定的模型文件 | |
csghub-lite search <query> | 在 CSGHub 平台上搜索模型或数据集 | |
| 服务管理 | csghub-lite ps | 列出服务器上当前正在加载并运行的模型 |
csghub-lite stop <model> | 停止并卸载内存中运行的模型,释放内存/显存 | |
csghub-lite restart | 重启后台运行的 API 服务 | |
| 配置/认证 | csghub-lite login | 配置 CSGHub 平台的访问令牌(Access Token) |
csghub-lite config | 查看、设置或管理本地配置项 | |
| 其他 | csghub-lite --version 或 -v | 查看当前客户端版本信息 |
csghub-lite help | 查看帮助文档 | |
csghub-lite completion | 生成 Shell 自动补全脚本 |
模型运行命令
csghub-lite run
自动下载模型(如果本地不存在)并启动交互式对话。
用法
csghub-lite run <model> [flags]
选项(Flags)
| 选项 | 说明 | 默认值 |
|---|---|---|
--num-ctx <n> | 仅对本次运行生效的上下文窗口大小 | 使用服务默认值(如 4096) |
--num-parallel <n> | 仅对本次运行生效的并行槽数;设为 1 可优先给单会话分配更大上下文 | 使用服务默认值 |
--n-gpu-layers <n> | 仅对本次运行生效的 GPU 卸载层数;设为 0 表示仅使用 CPU | GPU 环境下默认全量 offload |
--cache-type-k <type> | KV cache 的 K 键量化类型,可选:f32, f16, bf16, q8_0, q4_0, etc. | llama-server 默认值 |
--cache-type-v <type> | KV cache 的 V 值量化类型,可选:f32, f16, bf16, q8_0, q4_0, etc. | llama-server 默认值 |
--dtype <type> | SafeTensors 转换为 GGUF 时的输出类型,可选:f32, f16, bf16, q8_0, tq1_0, tq2_0, auto | f16 |
示例
# 自动拉取并运行模型
csghub-lite run Qwen/Qwen3-0.6B-GGUF
# 单会话大上下文模式
csghub-lite run Qwen/Qwen3-0.6B-GGUF --num-ctx 131072 --num-parallel 1
# 显存紧张时压缩 KV cache 精度以减少显存占用
csghub-lite run Qwen/Qwen3-0.6B-GGUF --cache-type-k q8_0 --cache-type-v q8_0
csghub-lite chat
与已下载的本地模型启动交互式对话。如果模型未下载,会提示错误。
用法
csghub-lite chat <model> [flags]
选项(Flags)
支持与 run 命令相同的所有推理控制参数(--num-ctx, --num-parallel, --n-gpu-layers, --cache-type-k, --cache-type-v, --dtype),此外还包含:
--system <prompt>:设置当前会话的自定义系统提示词(System Prompt)。
示例
# 启动对话
csghub-lite chat Qwen/Qwen3-0.6B-GGUF
# 启动并预设为中文翻译助手
csghub-lite chat Qwen/Qwen3-0.6B-GGUF --system "你是一个翻译助手,负责把输入全部翻译为中文。"
csghub-lite serve
手动启动本地 REST API 服务,为外部应用提供 Ollama/OpenAI 兼容接口。
用法
csghub-lite serve [flags]
选项
--listen <addr>:指定监听端口与地址。默认使用配置文件中的listen_addr(通常为:11435)。
示例
# 启动服务
csghub-lite serve --listen :8080
模型管理命令
csghub-lite pull
从 CSGHub 平台下载指定模型文件。
用法
csghub-lite pull <model>
csghub-lite list / ls
列出所有已成功下载并缓存在本地磁盘的模型。
用法
csghub-lite list
csghub-lite show
查看指定模型的详细元信息(如格式、文件大小、具体组成文件)。
用法
csghub-lite show <model>
csghub-lite rm
从本地磁盘删除指定的模型,释放磁盘空间。
用法
csghub-lite rm <model>
csghub-lite search
在 CSGHub 平台上搜索指定的模型或数据集。
用法
csghub-lite search <query>
服务管理命令
csghub-lite ps
列出本地服务器当前正在运行(已加载进内存/显存)的模型。
示例
$ csghub-lite ps
NAME FORMAT SIZE UNTIL
Qwen/Qwen3-0.6B-GGUF gguf 609.8 MB 5 minutes
csghub-lite stop
手动停止并卸载服务器上正在运行的模型,立刻释放内存和 GPU 显存资源。
用法
csghub-lite stop <model>
csghub-lite restart
重启后台运行的 API 服务。如果服务未运行,也会拉起一个新的后台服务。
用法
csghub-lite restart
配置与认证命令
csghub-lite login
配置 CSGHub 平台的访问令 牌(Access Token),以便拉取和运行私有模型。
用法
csghub-lite login
csghub-lite config
查看和管理 CSGLite 的配置信息。配置文件位于 ~/.csghub-lite/config.json。
子命令与示例
# 1. 显示当前所有配置
csghub-lite config show
# 2. 切换到私有化部署的传神社区地址
csghub-lite config set server_url https://my-csghub.example.com
# 3. 统一设置本地数据与模型存储路径
csghub-lite config set storage_dir /data/csghub-lite
# 4. 获取单个配置的值
csghub-lite config get storage_dir