别再手动试 prompt 了:gpt-prompt-engineer 让 10 个候选提示自己打擂选出最优

别再手动试 prompt 了:gpt-prompt-engineer 让 10 个候选提示自己打擂选出最优 别再手动试 prompt 了gpt-prompt-engineer 让 10 个候选提示自己打擂选出最优【免费下载链接】gpt-prompt-engineergpt-prompt-engineer - 一个工具用于自动化生成、测试和排名多种提示以找到最适合特定任务的提示。项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-prompt-engineer改了十几版 prompt输出还是不对越删改越乱。gpt-prompt-engineer 把调提示这件事流水线化了你给任务描述和测试用例它自动生成 10 个候选提示两两对比打分最后输出一张按 ELO 分排序的表哪条 prompt 好用一目了然。它凭什么靠谱把每条 prompt 放上 ELO 擂台候选提示从哪来想象一个文案团队开会每人抛一个思路再集体投票。generate_candidate_prompts干的就是这件事让 GPT-4或 GPT-3.5-Turbo在 0.9 的高温下一次生成 n 条风格各异的 system prompt天然覆盖不同写法。生成规则里还有一条防作弊条款——候选提示不许夹带测试用例的细节带具体示例的直接作废比的是通用性而不是记忆。ELO 评分机制怎么运作ELO 就是国际象棋那套棋手积分分高的赢分低的加分少分低的爆冷加得多。每个候选提示初始 1200 分然后在所有测试用例上两两对决两个提示各自跑同一个输入由一个专门的评判模型判断哪份输出更好。同一场比赛会正反各判一次再取平均抵消排在前面的更容易赢的位置偏好核心计算在gpt_prompt_engineer.ipynb的update_elo()函数里先按实力差距算出期望胜率再用系数 K默认 32乘以实际偏差调整双方积分。所有对局打完最终分数就是每条提示的真实水平。实际操作从打开 notebook 到拿到评分表打开 notebook 并配置 API key克隆仓库后打开gpt_prompt_engineer.ipynb或者直接在 Google Colab 里打开。前几个单元填 key、调参数即可openai.api_key ADD YOUR KEY HERE CANDIDATE_MODEL gpt-4 # 没有 GPT-4 权限就改成 gpt-3.5-turbo NUMBER_OF_PROMPTS 10 # 建议从 10 起步越多效果越好、账单越厚generate_optimal_prompt一次跑下来会经历生成候选 → 逐对测试 → 更新积分三个阶段测试用例最多填 15 条。如何配置任务描述与测试用例最后一个单元只填两样东西一句任务描述和一组测试输入。README 里建议的描述风格是这样的description Given a prompt, generate a landing page headline. test_cases [ {prompt: Promoting an innovative new fitness app, Smartly}, {prompt: Why a vegan diet is beneficial for your health} ]这里只放输入不放期望答案——自由生成类任务没有标准答案好不好由后面的评判模型说了算。跑起来看结果长什么样一行调用进入全自动流程generate_optimal_prompt(description, test_cases, NUMBER_OF_PROMPTS, use_wandb)运行时会滚动打印每局的胜者最后用 PrettyTable 输出按 Rating 降序的评分表格式大致如下数字为示意PromptRatingWrite a short, benefit-driven headline under 8 words...1312Act as a seasoned copywriter, make the user feel something...1188......拿第一名直接进生产比盯着屏幕手动试强太多。场景与进阶营销文案产品或运营同学写 landing page 标题、社媒文案手工改 prompt 一天试不出风格。跑一轮十条不同写法的候选自动排好序把第一名贴进生产流程就行。文本分类情感分析、垃圾邮件检测这类有标准答案的场景换用gpt_prompt_engineer_Classification_Version.ipynb。测试用例带上output字段true 或 false评分改为精确匹配输出的是每条提示的得分表。多变量输入按发件人、收件人个性化回邮件时用claude_prompt_engineer.ipynb。声明input_variables后测试用例由模型根据描述自动生成不用自己凑数据。仓库里四个 notebook 各管一摊gpt_prompt_engineer.ipynb通用版GPT-4 / GPT-3.5-Turbogpt_prompt_engineer_Classification_Version.ipynb二分类任务按 true/false 精确匹配计分claude_prompt_engineer.ipynbClaude 3 Opus自动生成测试用例、支持多输入变量opus_to_haiku_conversion.ipynb先让 Opus 产出一批高质量示例再交给 Haiku 照着答质量基本不降成本和延迟大幅降低进阶玩法一句话把use_wandb设为 True配置、测试用例和最终评分表都会记到 Weights Biases方便复现和对比多次实验。仓库git clone https://gitcode.com/GitHub_Trending/gp/gpt-prompt-engineer入口gpt_prompt_engineer.ipynb分类、Claude 3、Opus→Haiku 各有独立 notebook许可证MIT配好 key 跑通第一个单元你的第一张 ELO 评分表就出来了。【免费下载链接】gpt-prompt-engineergpt-prompt-engineer - 一个工具用于自动化生成、测试和排名多种提示以找到最适合特定任务的提示。项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-prompt-engineer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考