DeepSeek Coder
DeepSeek Coder 是 DeepSeek 推出的开源代码语言模型系列。该系列包括基础和指令调优版本,参数量从 1B 到 33B 不等,全部在包含 87% 代码和 13% 英语及中文自然语言的 2 万亿标记上从零开始训练。权重已在 Hugging Face 上发布,你可以通过 chat.deepseek.com 试用这些模型,或在 GitHub 仓库中使用示例在本地运行。
这些模型面向项目级工作,而不仅仅是单行代码片段。训练采用 16K 标记窗口和填空任务,使模型能够在仓库的多个文件中完成或插入代码。在仓库中公布的基准测试结果显示,DeepSeek-Coder-Base-33B 在 HumanEval Python、HumanEval Multilingual、MBPP 和 DS-1000 上领先于 CodeLlama-34B。据报道,指令调优的 33B 模型在 HumanEval 上优于 GPT-3.5-turbo,并在 MBPP 上与其持平。
仓库包含推理演示、本地 Gradio 演示、DeepSpeed 微调脚本和可复现的评估代码。支持的语言包括 Python、JavaScript、Go、Rust、TypeScript 等数十种。仓库代码采用 MIT 许可证,模型许可证允许商业使用。
软件开发者和机器学习工程师使用 DeepSeek Coder 进行编辑器内补全、多文件填充、编码聊天助手以及在自定义指令数据集上的微调。
四种模型规模,从1B到33B,每种均有基础版和指导版
16K上下文窗口,支持多文件和代码仓库级别的代码补全
填空式预训练,支持在现有代码块之间插入代码
覆盖80多种语言,包括Python、JavaScript、Go、Rust和Solidity
仓库中提供使用DeepSpeed的微调脚本及vLLM推理示例
开放模型权重和MIT许可的代码仓库,允许商业使用。
发布的基准测试显示其在多个测试中领先于其他开源代码模型。
多种参数规模让团队可以在推理速度和能力之间进行权衡。
较大的33B模型需要大量GPU内存以支持本地推理。
文档主要集中在GitHub的README文件,而非独立的文档网站。
Instruct模型需要更改eos_token_id以实现最佳的代码补全表现。
什么是 DeepSeek Coder?
DeepSeek Coder 是 DeepSeek 发布的一系列开源代码语言模型。这些模型支持代码补全、填充、仓库级生成以及多种编程语言的指令式编程任务。
DeepSeek Coder 提供哪些模型规模?
DeepSeek Coder 提供 1B、5.7B、6.7B 和 33B 参数规模。每个规模都有一个基础模型用于代码补全,以及一个针对聊天式编程请求调优的指令模型。
DeepSeek Coder 是免费使用的吗?
是的。DeepSeek Coder 的模型权重可在 Hugging Face 获取,仓库代码采用 MIT 许可证,项目声明模型许可证支持商业用途。
如何在本地运行 DeepSeek Coder?
DeepSeek Coder 在其 GitHub README 中提供了使用 Hugging Face Transformers 和 PyTorch 的 Python 示例。你也可以从 demo 文件夹运行本地 Gradio 演示,或使用 vLLM 进行更高吞吐量的推理。
DeepSeek Coder 在哪些基准测试中表现良好?
DeepSeek Coder 在 HumanEval、MultiPL-E、MBPP、DS-1000 和 APPS 上报告了较高的 pass@1 分数。README 中包含详细的评估表格和 Evaluation 目录下的脚本。
我可以用自己的数据微调 DeepSeek Coder 吗?
可以。DeepSeek Coder 包含带有 DeepSpeed 支持的 finetune_deepseekcoder.py 脚本。训练数据应遵循 finetune README 中描述的指令和输出 JSONL 格式。

