使用排障
先记录目标站点、个人/组织身份、资源 ID、发生时间与错误信息。自部署用户联系本实例管理员;传神社区用户可 联系支持。提交日志前移除凭据。
| 现象 | 检查顺序 | 相关说明 |
|---|---|---|
| Token 无效或认证失败 | 核对站点与地址 → 区分 Access Token/API Key → 检查刷新、过期或删除状态 → 检查请求头 | Access Token、API Keys |
| 仓库不存在或无权限 | 核对命名空间、资源类型与 ID → 确认是否迁移至组织 → 检查成员和有效权限 | 组织 |
| 没有部署/微调按钮 | 检查模型文件与元数据 → 确认该模型版本是否配置相应框架和镜像 → 联系管理员扫描或配置 | 推理 FAQ、微调 FAQ |
| 上传被拒绝或中断 | 检查写权限、文件大小和服务报错 → 核对站点限制 → 使用对应仓库类型的 CLI/SDK;保留断点进度 | 上传模型、上传数据集 |
| Git 下载后只有小型文本指针 | 确认已安装 Git LFS → 在仓库目录执行 git lfs pull → 查看认证、网络和剩余磁盘空间 | 下载模型 |
| 实例持续排队或启动失败 | 看实例日志 → 检查可用资源/配额 → 检查镜像拉取、模型下载和存储挂载 → 请管理员检查调度状态 | 实例使用 |
| 显存不足或模型加载失败 | 核对模型精度/量化、框架版本、上下文长度及并发 → 检查权重完整性 → 按需要调整规格或参数 | 推理框架 |
| API 超时、限流或返回错误 | 核对 URL、模型标识、Key 和权限 → 检查服务状态、配额与账户 → 保存响应错误,避免无限重试 | API Keys |
| 训练完成但资源仍运行 | 确认成果已导出 → 主动停止实例 → 检查列表状态和用量记录 | 实例、数据与用量 |
提交问题时提供什么
提供软件/客户端版本、最小复现步骤、预期与实际结果、发生时间及其时区、资源 ID、错误状态和脱敏日志。如响应含请求 ID,一并记录。不要提供真实 Token、密码或未经处理的业务数据。