调参别再靠运气!Temperature、Top-p、思维链,手把手教你驯服AI 📅 发布时间:2026/9/12 21:19:27 👁 浏览次数: 上一篇我们聊了是怎么划重点读懂你的话的。不过仍有不少读者, 在看完之后, 或许就会心生这样的想法: “虽说原理已然明白, 然而为何我所使用的人工智能, 老是给出答非所问的回应呢? ”。答案是十分简单的, 你与AI进行“说话”的此种方式, 直接对它的智商表现起到了决定性作用。说是相同的一个GPT - 4, 有的人可以促使它撰写出具备专业级别的代码, 有的人却是哪怕想让它罗列一份清单之类的都遭遇到难事, 这是怎么回事呢。差距不在模型而在提示工程 。今儿这一篇, 我将要把, Top-p, 零样本提示, 思维链, 分词, 模型选型, 这些听着特别唬人的概念, 统统翻译成你能够直接着手去做的话语。看完这篇你对大模型的掌控力会提升一个档次。① 三个参数调AI就像调咖啡机采取大模型API之际, 你将目睹若干参数, 好多人径直进行默认设定, 随后便抱怨“AI不稳定”。这三个参数本质上是在控制AI的性格温度控制保守vs发散温度值效果适用场景0-0.3精准、确定、重复率高代码生成、数学计算、事实问答0.3-0.7平衡、自然日常对话、邮件撰写、客服0.7-2.0创新、发散、可能胡言乱语诗歌创作、头脑风暴、广告文案其原理是这样的, 很简单, 温度越是低的时候, AI 就越是倾向于去选择概率最高的词, 而温度要是越高的话, 就越会给那些低概率的词以机会。如同掷骰子的情况, 在低温的状况下, AI仅仅只会选择“6”这个选项是最具可能性的, 而在高温的时候, 它存在着选择“1”的可能性属于出其不意的那种情况。Top-k只让AI在前k名里选把所有候选词按概率排序只保留前k个再从中采样。Top-p核采样动态调整候选范围不是按照固定的数量, 而是依据累积的概率, 从高到低进行累加, 一直到总和达到p比如说0.9, 将这些词当作候选集。Top - p相较于Top - k更具聪慧特质这是由于在某些情形中前10个词占据了百分之九十九的概率, 而在另外一些情形里前100个词才占到百分之九十, 并且Top - p具备自适应的特性。实战建议② 三种提示方式给示例就是给模板根据你给AI示例的数量提示分为三种零样本Zero-shot直接下指令请把下面这段话翻译成英文你好世界。适应场景为, 简单与显著的特定任务, 因预训练之故, 当下的模型, 诸如等, 其零样本的效能已然十分强大。单样本One-shot给一个例子文本这家餐厅的服务太慢了。情感负面 文本Datawhale的AI课程非常棒情感AI会模仿示例的格式自动补全正面。少样本Few-shot给多个例子文本这家餐厅的服务太慢了。情感负面 文本这部电影情节很平淡。情感中性 文本Datawhale的AI课程非常棒情感示例数量越是增多, AI 对于任务边界的理解就越是精准无误。尤其是在处理那些具备复杂格式、特定风格以及细微差别的情况之时, 少样本提示所产生的效果更是极为突出显著。关键心法③ 三大实战技巧让AI从能用变好用技巧一角色扮演Role-给AI一个身份它的回答风格、语气、知识范围会立刻改变。你现在是资深Python编程专家。请解释GIL是什么要让初学者也能听懂。vs你现在是大学教授正在给计算机系本科生上课。请解释GIL是什么。同一个问题, 存在着两种角色, 有着两种回答风格, 角色扮演是能够在零成本的情况下提升输出质量的神器。技巧二上下文示例In- 不仅告诉AI做什么还告诉它怎么做和输出格式。我需要你从产品评论中提取产品名称和用户情感。请严格按照下面的JSON格式输出。 评论这款星尘笔记本电脑的屏幕显示效果惊人但我不太喜欢它的键盘手感。 输出{product_name: 星尘笔记本电脑, sentiment: 混合} 评论我刚买的声动耳机音质很棒续航也超出了我的预期 输出AI会依照你所给予的格式进行自动临摹, 这比讲出一百句“请用JSON格式输出”还要具有效力, 是这样的呢。技巧三思维链Chain-of-, CoT对于需要推理、计算、多步骤思考的问题在提示末尾加一句请一步一步地思考。效果有多夸张看一个真实案例不加CoT问一个篮球队赛季1打了80场胜率60%。赛季2打了15场赢了12场。总胜率是多少 AI可能直接猜一个错误答案。加CoT问……总胜率是多少请一步一步地思考。 AI输出 1. 赛季1赢了80 × 60% 48场 2. 总比赛数80 15 95场 3. 总胜利数48 12 60场 4. 总胜率60/95 ≈ 63.16%一句话, 能将AI的数学准确率, 从百分之三十提升至百分之九十, 这便是思维链所形成的威力。④ 分词的秘密为什么你的长文档总是超字数有不少人觉得大模型的那个“上下文窗口”是依照字数去计算的, 这样的认知是错误的, 实际上, 它是按照Token来进行计算的。什么是Token被称为大模型的事物, 无法理解文字, 它仅仅能够看懂数字, 负责将文字切割成最小数字单元的分词器, 所切出的这个单元被称作Token。关于关键认知, 存在这样的情况, 即1.5个汉字大约等同于1个Token, 同时, 0.75个英文单词大约等同于1个Token。标点、数字、代码、URL、生僻词, 这些都会对token数产生影响, 不存在绝对精确的换算公式。这意味着字数约为两千字的中文文章, 大约等同于是一千到一千五百个Token。该模型具备的那种8K上下文窗口, 实际上仅仅能够装入差不多大概5000到6000个汉字。更反直觉的是同一个词大小写不同Token数可能不同。还有更坑的这对智能体开发者意味着什么使用上下文管理时要知道你的“长记忆”并非没有限制, 8K、128K这些数值所代表的是Token上限, 并非是我们平常思维理解意义之中的字数上限而采用计数, API成本又是按照Token来计费的, 中文相较于英文会“省Token”, 原因在于中文的信息密度更高提供信息能力强, 提醒为模型加入提示词的时候不能单纯设计, 还需要避免对于特别少见的拼写, 要留意英文单词需注意区分空格, 也要注意大小写的严格规范, 尽量减少出现不必要的Token被消耗的情况最后在模型选择方面, 有一张表能够完善且妥当搞定你对于模型的抉择此项事宜。面对几百个大模型怎么选核心原则不是选最强的而是选最适合的。考量维度关键问题建议性能任务需要推理、代码、还是创意查LMSys Arena排行榜成本预算多少调用频率高吗闭源按Token计费开源需GPU速度需要实时交互吗选轻量级模型GPT-3.5、 Haiku上下文窗口需要处理长文档吗选128K的模型、部署方式数据敏感吗敏感数据本地开源模型一般场景API生态需要社区支持和工具链吗选主流模型GPT、Llama、Qwen闭源模型开箱即用开源模型可定制新手建议写在最后工程提示并非是那种玄之又玄的学问, 它属于一门涉及怎样跟人工智能切实、有用地进行交流沟通的实用性质的技术。核心心法就三条1. 说清楚你要什么角色、格式、约束条件2. 给示例比给指令更有效少样本 零样本3. 复杂任务让它一步一步想思维链加上, 对于参数的理解, 也就是调性格, 对于Token的认知, 亦即用此去控制成本与长度, 对于模型的选择, 即要匹配相应场景, , 你便已然超越了百分之九十的AI使用者。你在用大模型时最常用的提示技巧是什么评论区聊聊