什么情况下需要自己跑AI?

大部分场景下,直接调用云端API(DeepSeek、OpenAI、Groq等)是最划算的选择。但有些情况下,你可能想自己部署:

1. 隐私敏感:数据不能上传到第三方服务器(医疗、法律、企业内部)

2. 离线场景:网络不稳定或需要在内网运行

3. 大量调用:每天需要处理海量请求,自建比调API便宜

4. 学习研究:想了解模型推理的底层原理

主流部署方案

Ollama(最简单)

一行命令就能跑起来的AI推理工具,适合新手。支持Llama、Qwen、Gemma等主流开源模型。

# 安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh

# 运行模型(自动下载)
ollama run llama3.3:8b
ollama run qwen2.5:7b
ollama run gemma2:9b

Ollama默认监听11434端口,兼容OpenAI API格式。

vLLM(性能最强)

高性能推理引擎,支持PagedAttention、连续批处理等优化。适合需要高吞吐的生产环境。

# 安装
pip install vllm

# 启动服务
vllm serve meta-llama/Llama-3.3-70B-Instruct \
  --tensor-parallel-size 2 \
  --max-model-len 4096

llama.cpp(CPU专用)

纯CPU推理方案,不需要GPU。适合只有CPU的VPS。性能比GPU慢很多,但小模型(7B以下)在高配CPU上也能用。

配置推荐:能跑什么模型?

配置可跑模型速度参考适用场景VPS价格参考
4核CPU + 8G RAMQwen2.5-3B, Llama-3.2-3B~5 tok/s简单对话、测试$10-15/月
8核CPU + 16G RAMQwen2.5-7B, Llama-3.3-8B~8 tok/s日常使用$20-30/月
16核CPU + 32G RAMLlama-3.3-8B (Q4), Qwen2.5-14B~12 tok/s中等负载$40-60/月
1×A10G (24G显存)Llama-3.3-70B (Q4), Qwen2.5-72B~30 tok/s生产环境$0.5-1/时
1×A100 (80G显存)Llama-3.3-70B (FP16), Qwen2.5-72B~60 tok/s高吞吐生产$2-4/时
4×A100 (320G显存)Llama-3.3-405B (FP16)~40 tok/s顶级部署$10-20/时

价格参考:便宜VPS(RackNerd等)$10-40/月;GPU云(Vast.ai、RunPod等)按小时计费。

成本对比:自建 vs 调API

使用量自建VPS月成本调API月成本推荐
每天100次对话$20-40(CPU VPS)$1-5调API
每天1000次对话$40-60(CPU VPS)$10-50看模型
每天1万次对话$100-200(GPU VPS)$100-500自建
每天10万次对话$500-1000(多GPU)$1000+自建

结论:日常使用调API最划算,只有在请求量非常大的时候自建才划算。

常见问题

?
没有GPU能跑AI吗?
可以,用llama.cpp做CPU推理。7B模型在16核CPU+32G内存上能跑,速度约5-12 tok/s,简单对话够用。
?
便宜VPS能跑什么模型?
RackNerd $10/年的768M机型只能跑最小的模型(1-3B参数),实用性有限。建议至少2G内存起步。
?
哪里可以租到便宜GPU?
Vast.ai、RunPod、Lambda Labs等平台提供按小时计费的GPU实例。A10G大约$0.2-0.5/时,适合短时间跑模型。