什么情况下需要自己跑AI?
大部分场景下,直接调用云端API(DeepSeek、OpenAI、Groq等)是最划算的选择。但有些情况下,你可能想自己部署:
1. 隐私敏感:数据不能上传到第三方服务器(医疗、法律、企业内部)
2. 离线场景:网络不稳定或需要在内网运行
3. 大量调用:每天需要处理海量请求,自建比调API便宜
4. 学习研究:想了解模型推理的底层原理
主流部署方案
Ollama(最简单)
一行命令就能跑起来的AI推理工具,适合新手。支持Llama、Qwen、Gemma等主流开源模型。
# 安装 Ollama curl -fsSL https://ollama.com/install.sh | sh # 运行模型(自动下载) ollama run llama3.3:8b ollama run qwen2.5:7b ollama run gemma2:9b
Ollama默认监听11434端口,兼容OpenAI API格式。
vLLM(性能最强)
高性能推理引擎,支持PagedAttention、连续批处理等优化。适合需要高吞吐的生产环境。
# 安装 pip install vllm # 启动服务 vllm serve meta-llama/Llama-3.3-70B-Instruct \ --tensor-parallel-size 2 \ --max-model-len 4096
llama.cpp(CPU专用)
纯CPU推理方案,不需要GPU。适合只有CPU的VPS。性能比GPU慢很多,但小模型(7B以下)在高配CPU上也能用。
配置推荐:能跑什么模型?
| 配置 | 可跑模型 | 速度参考 | 适用场景 | VPS价格参考 |
|---|---|---|---|---|
| 4核CPU + 8G RAM | Qwen2.5-3B, Llama-3.2-3B | ~5 tok/s | 简单对话、测试 | $10-15/月 |
| 8核CPU + 16G RAM | Qwen2.5-7B, Llama-3.3-8B | ~8 tok/s | 日常使用 | $20-30/月 |
| 16核CPU + 32G RAM | Llama-3.3-8B (Q4), Qwen2.5-14B | ~12 tok/s | 中等负载 | $40-60/月 |
| 1×A10G (24G显存) | Llama-3.3-70B (Q4), Qwen2.5-72B | ~30 tok/s | 生产环境 | $0.5-1/时 |
| 1×A100 (80G显存) | Llama-3.3-70B (FP16), Qwen2.5-72B | ~60 tok/s | 高吞吐生产 | $2-4/时 |
| 4×A100 (320G显存) | Llama-3.3-405B (FP16) | ~40 tok/s | 顶级部署 | $10-20/时 |
价格参考:便宜VPS(RackNerd等)$10-40/月;GPU云(Vast.ai、RunPod等)按小时计费。
成本对比:自建 vs 调API
| 使用量 | 自建VPS月成本 | 调API月成本 | 推荐 |
|---|---|---|---|
| 每天100次对话 | $20-40(CPU VPS) | $1-5 | 调API |
| 每天1000次对话 | $40-60(CPU VPS) | $10-50 | 看模型 |
| 每天1万次对话 | $100-200(GPU VPS) | $100-500 | 自建 |
| 每天10万次对话 | $500-1000(多GPU) | $1000+ | 自建 |
结论:日常使用调API最划算,只有在请求量非常大的时候自建才划算。
常见问题
没有GPU能跑AI吗?
可以,用llama.cpp做CPU推理。7B模型在16核CPU+32G内存上能跑,速度约5-12 tok/s,简单对话够用。
便宜VPS能跑什么模型?
RackNerd $10/年的768M机型只能跑最小的模型(1-3B参数),实用性有限。建议至少2G内存起步。
哪里可以租到便宜GPU?
Vast.ai、RunPod、Lambda Labs等平台提供按小时计费的GPU实例。A10G大约$0.2-0.5/时,适合短时间跑模型。