1、准备硬件
优先 NVIDIA 显卡,看显存:
7B 小代码模型(日常写代码、查 bug):16G 显存显卡就行,适合小团队
32B 大模型(读整个项目、代码重构):24G 以上显存,多卡更好
用量化模型,能省大量显存,代码能力损失不大
2、外网提前下载全部资源
1. 模型文件:Qwen-Coder / DeepSeek-Coder 的量化权重
2. 软件:Ollama(简单试用)或者 vLLM(正式上线)
3. 所有依赖包 / Docker 镜像
全部打包,拷贝到内网服务器(U 盘 / 内网文件服务器传输)
3、内网服务器安装
两种方案二选一:
方案 1 简单试用:Ollama
装好 Ollama,把拷过来的模型放对应目录,启动服务,开放内网访问。
其他开发电脑(VS Code)通过内网 IP 连这个模型服务,做代码补全、查代码。
方案 2 正式生产:vLLM
性能更高,支持更多开发并发,提供 API,VS Code 插件可以接入。
4、企业必做安全配置
1. 防火墙:只允许开发网段访问模型端口
2. 加账号/API 密钥,不是谁都能随便访问
3. 开启日志,记录调用记录,方便审计
4. 服务器禁止访问外网
5、接入开发 IDE
VS Code 装 Continue 插件,填内网模型服务地址,就能在内网写代码、解释代码、生成单元测试,代码全程留在内网。