为什么还需要另一个 AI?
大语言模型市场已经拥挤不堪:OpenAI、Anthropic、Google、Meta。还能往哪走?答案来自杭州:2025 年 1 月,DeepSeek 发布了 R1,一个推理模型,在数学基准测试中接近 OpenAI 的 o1,同时在性价比上超越了所有西方竞争对手。
让我们深入了解其内部构造、如何集成以及它与熟悉的 API 有何不同。
架构:内部机制
DeepSeek 使用专家混合(MoE)原则构建模型——不是一个庞大的单一网络,而是一组根据任务激活的专业"专家"集合。
DeepSeek-R1(2025 年 1 月):总计 6710 亿参数,但每个 token 只有 370 亿活跃参数。这提供了与 5–10 倍小的模型相当的推理速度,质量接近 GPT-4o。R1 使用强化学习进行思维链推理——模型通过 RL 学会了"思考",无需监督微调。
DeepSeek-V3(2024 年 12 月):基础模型,671B 参数,37B 活跃。128K token 上下文窗口。支持文件上传和网页搜索。
DeepSeek-Coder V2:专门的编码模型。支持 338 种编程语言,128K 上下文。在 HumanEval 上表现达到 GPT-4o 水平。
关键架构差异:DeepSeek 在 MIT 许可下开源模型权重,允许企业自托管部署。
API 和集成
DeepSeek API 兼容 OpenAI SDK。从 OpenAI 迁移只需更改三个参数。模型通过 API 提供:deepseek-chat(V3)和 deepseek-reasoner(R1)。
定价(2026 年 8 月):
- V3:每百万输入/输出 token $0.27/$1.10
- R1:$0.55/$2.19
比 GPT-4o 输入 token 便宜 5–10 倍。R1 在推理任务上的质量与 o1 统计上无差异。
API 不可用:图像生成、微调(测试版计划中)、延迟批处理。
多语言能力:亚洲特色
DeepSeek 源自中国,语言支持反映了这一点。中文、日文、韩文——母语级别质量。英文——与领先西方模型相当。俄文、德文、法文、西班牙文——理解良好,但在长文本生成中有明显的"中式"模式。印地语、阿拉伯语、葡萄牙语——基本任务可接受。
对于以亚洲为目标市场的多语言项目,DeepSeek 是最佳选择之一。
安全与自我审查
DeepSeek 内置了符合中国法律要求的内容过滤系统。某些政治话题在模型级别被屏蔽。API 数据存储在中国服务器上。对于敏感项目,可通过开放权重进行自托管部署。
合作伙伴计划
- 佣金: 推荐用户 12 个月内付款的 20%
- 归因模型: 最后点击,30 天 cookie
- 付款: 每月,最低 $50,通过 PayPal 或银行转账
- 注意: 佣金仅适用于付费 API token,不适用于免费网页聊天
技术结论
DeepSeek 不是"又一个中国 LLM"。这是一个工程实力强大的产品,具有开放权重、兼容 OpenAI 的 API 和重新定义市场的价格。
选择 DeepSeek:推理任务、亚洲语言、高容量 API 使用。保留 GPT-4o/Claude:欧洲语言的创意写作、高合规要求的任务、有 SLA 的企业合同。