mshumer/gpt-prompt-engineer - GitHub
mshumer/gpt-prompt-engineer 是一个开源的提示词工程工具包,可为您定义的任务生成、测试和排序候选提示词。您描述用例、提供测试用例,笔记本会创建多个提示词变体,在每个测试用例上运行它们,并使用 ELO 评分系统(起始分为 1200)对结果进行排序。它以 Jupyter 笔记本形式提供,您可以在 Google Colab 或本地运行。
大多数提示词工具一次只帮助您编写一个提示词。gpt-prompt-engineer 则将提示词选择视为一场锦标赛:数十个候选提示词在您的测试用例上竞争,最高 ELO 分数会显示出获胜者。单独的笔记本涵盖分类任务、使用自动生成测试用例的 Claude 3 Opus,以及用于降低推理成本的 Opus-to-Haiku 转换。可选的 Weights & Biases 和 Portkey 可记录每次运行的追踪信息。
ML 工程师、提示词工程师和 AI 开发者在需要可复现的提示词调优(而非手动反复试错)时会使用它。该仓库在 GitHub 上获得了 9.7k 星标,并可使用您自己的 OpenAI 或 Anthropic API 密钥运行。它在 MIT 许可证下免费使用。
从任务描述和用户提供的测试用例生成多个提示候选
使用 ELO 评分系统对提示进行排名,每个候选初始分为 1200
支持 GPT-4、GPT-3.5-Turbo 与 Claude 3 Opus 模型后端
分类笔记本对真/假测试用例进行评分并打印结果表格
Claude 3 笔记本从输入变量定义自动生成测试用例
Opus-to-Haiku 转换笔记本降低延迟与成本,同时保持输出质量
可选 Weights & Biases 与 Portkey 记录以进行实验跟踪
自动化提示竞赛测试,无需手动逐一重写
ELO 排名让你轻松比较数十个候选提示在相同测试用例上的表现
多个笔记本涵盖分类、Claude 3 与 Opus-to-Haiku 转换
需自备 OpenAI 或 Anthropic API 密钥并完成笔记本设置
大规模生成多个提示候选可能成本高昂
无托管 UI,完全在 Jupyter 笔记本中操作
mshumer/gpt-prompt-engineer能免费使用吗?
是的,mshumer/gpt-prompt-engineer是免费且开源的,采用MIT许可证发布在GitHub上。您可以在Google Colab或本地运行Jupyter笔记本,仅需支付自行使用的OpenAI或Anthropic API费用。
gpt-prompt-engineer如何对提示词进行排名?
mshumer/gpt-prompt-engineer会将每个生成的提示词与您的测试用例进行对比,并使用ELO评分系统进行排名。每个提示词初始评分为1200 ELO,根据在您的输入上的对抗性能增减积分。
gpt-prompt-engineer支持哪些模型?
mshumer/gpt-prompt-engineer支持GPT-4、GPT-3.5-Turbo和Claude 3 Opus,具体取决于运行的笔记本。Opus-to-Haiku转换笔记本将Claude 3 Opus规划与Claude 3 Haiku生成配对,以降低成本。
如何运行mshumer/gpt-prompt-engineer?
mshumer/gpt-prompt-engineer以Jupyter笔记本形式在GitHub上托管。在Google Colab中打开gpt_prompt_engineer.ipynb,添加您的OpenAI API密钥,定义用例描述和测试用例,然后调用generate_optimal_prompt启动竞赛。
gpt-prompt-engineer能处理分类任务吗?
是的,mshumer/gpt-prompt-engineer包含一个分类版本笔记本,可在真/假测试用例上评估提示词。每个测试用例将提示词与预期输出标签配对,笔记本会为每个候选提示词打印评分表。
gpt-prompt-engineer在GitHub上有多少颗星?
mshumer/gpt-prompt-engineer在GitHub仓库页面上约有9,700颗星和681个分支。该项目由Matt Shumer维护,最后一次README更新是在2025年10月。

