提示词工程保姆级教程:从结构化模板到稳定输出

🛒 面向知识工作者与开发者,从零掌握结构化提示词编写与迭代评测的方法。

教程目标与适用读者

本教程教你掌握提示词工程的核心方法与实操步骤:结构化写提示词、用样例评测迭代、建立个人模板库。不要求编程基础,适合任何希望稳定用好大模型的知识工作者、运营、产品与开发者。全程约 90 分钟可学完并上手。

一、前置准备 Checklist

  • [ ] 注册一个可用的大模型账号(ChatGPT / Claude / DeepSeek 任选,教程以 DeepSeek 为例,免费且中文友好)
  • [ ] 准备一个用于记录模板的笔记工具(Notion / 飞书 / 本地 Markdown)
  • [ ] 准备一个真实的重复性任务(如:写周报、写商品文案、整理会议纪要、写 SQL)
  • [ ] 准备 3-5 个该任务的"输入样例"与"期望输出样例"(验收样例)

二、认识提示词的四个要素

一个稳定输出的提示词通常包含四部分:

  1. 角色:让模型以特定身份进入状态(如"你是资深产品经理")
  2. 任务:明确要做什么(如"把需求整理成 PRD 大纲")
  3. 要求:可验收的约束(格式、长度、语气、禁忌)
  4. 示例:给 1-3 个输入输出的示范(few-shot),约束输出形态

经验法则:当规则描述不管用时,加示例;当示例太多时,精简为最典型的 1-3 个。

三、用五段式模板写第一个提示词

复制下面模板,替换括号内容,就得到第一版提示词:

# 角色
你是{身份描述},擅长{能力}。

# 任务
请完成:{具体任务描述}

# 输入
{任务输入或原文}

# 要求
1. 输出格式:{JSON/表格/列表/段落}
2. 长度:{字数或段落数}
3. 语气:{正式/亲和/简洁}
4. 禁忌:{不要做的事,如"不要编造数据"}
5. 如有不确定信息,请标注【待核实】

# 示例
输入:{示例输入}
输出:{示例输出}

在 DeepSeek 里粘贴运行,观察输出是否达到验收标准。

四、用样例评测迭代提示词

好的提示词是"测"出来的,不是一次写对的:

  1. 建验收样例:准备 3-5 组"输入 → 期望输出"。
  2. 跑测:把每组输入分别用当前提示词跑一遍。
  3. 记失败模式:统计失败属于哪类——格式错 / 内容错 / 遗漏 / 跑题。
  4. 针对性修:格式错就补示例与格式约束;内容错就加"只依据输入、不补充外部知识"等限制;遗漏就加检查清单。

示例迭代:提示词要求输出表格,但模型输出了列表,就在"要求"里加上"必须输出 Markdown 表格,列名包括:X、Y、Z",并给一个表格示例。

五、控制随机性与稳定性

  • 大多数对话产品默认有随机性,同一提示词结果会有波动。
  • 需要严格一致(如批量生成模板)时,在 API 中把 temperature 设为 0 或接近 0。
  • 业务结论类任务,可用"多次采样 + 取多数/人工裁决"降低偶发错误。
  • 重要指令放在提示词的开头与结尾(首尾效应),避免长上下文稀释注意力。

六、建立个人模板库

  1. 在笔记工具中建立「提示词模板」页面,每个模板一张卡片,字段:任务、提示词全文、输入示例、输出示例、适用边界、失败处理。
  2. 按任务分类(写作/整理/分析/代码/客服),为高频任务建立稳定版模板。
  3. 模板版本化:每次大改存为新版本,标注修改原因与日期。
  4. 每周回顾一次失败案例,把共性经验沉淀进模板。

七、验证方法

  • 成功率:同一提示词在 5 组验收样例上一次性达标 ≥4 组
  • 稳定性:同一输入跑 3 次,输出关键内容一致
  • 边界明确:能说清模板"不适用于什么情况"
  • 可移交:把模板交给同事,无需你讲解即可产出达标结果
  • 达标即视为该模板可上生产使用。

八、常见问题与排障(FAQ)

  1. 为什么我的提示词很详细输出还是乱? 检查是否缺示例;格式类约束用 few-shot 示例最有效。
  2. 同一提示词结果时好时坏? 降低 temperature 或多次采样;把关键约束放开头结尾。
  3. 模型总在编数据? 明确"只依据输入内容,不要补充外部事实",并要求标注【待核实】。
  4. 长文本任务后半段跑题? 拆成多个子任务分步处理,或把关键指令在中间重复一次。
  5. 模型版本升级后模板失效? 建立复测机制,模型更新后重跑验收样例。
  6. 不同模型表现差异大? 提示词与模型绑定:为每个主力模型各存一份微调版本,标注兼容模型。

九、进阶扩展

  • API 工程化:把稳定模板封装成函数/接口,用代码批量调用与评测
  • 自动化评测:用脚本批量跑验收样例,量化提示词改版效果
  • 思维链与高级技巧:对复杂推理任务使用"先分析、再回答"的分步指令,提升推理质量
  • 提示词 → 微调:当提示词收益递减时,把高频场景数据集用于模型微调,实现更高阶定制

十、实战示例:把"写周报"变成稳定模板

以"周报生成"任务为例,演示一次完整的提示词迭代:

v1(裸写)帮我写周报——输出很散,格式不对,不可用。

v2(加结构):按五段式模板补充角色、任务、要求与示例:

# 角色
你是认真细致的项目助理。

# 任务
根据我提供的工作记录,生成一份周报。

# 要求
1. 分三部分:本周进展 / 问题与风险 / 下周计划
2. 每部分用要点列出,进展处标注负责人
3. 只依据我提供的内容,不要补充
4. 输出 Markdown 格式

# 输入
{粘贴本周工作记录}

v2 结构对了,但"进展处标注负责人"经常漏。

v3(加示例):补充一组输入输出示例,让模型照着输出形态来。同时把"只依据输入、不补充"提到开头加强约束。

v4(加边界):补充"工作记录中没有提到的事项不要写进下周计划",避免模型自作主张。

每次修改后用 3-5 组不同记录跑测,统计成功率。当连续 5 组都达标后,把 v4 存进模板库,附验收样例与失败处理说明。这套"裸写→加结构→加示例→加边界→跑测达标"的路径,适用于几乎所有重复性任务。

十一、常用指令词速查表

意图 可用的指令词
约束输出格式 "必须输出 Markdown 表格,列名包括:X、Y、Z"
约束信息来源 "只依据我提供的输入,不要补充外部知识"
约束长度 "全文控制在 500 字以内,分 5 个要点"
约束语气 "用简洁、专业、不带营销腔的语气"
引导思考 "先分析问题,再给出结论,最后给建议"
让模型自查 "请以挑剔读者身份复查,指出 3 处可改进点"
处理不确定 "无法确定的信息标注【待核实】"
多轮精修 "保持上次结构,只把第二段改写得更具体"

把这些指令词组合进五段式模板,就能覆盖绝大多数写作、整理、分析类任务。

十二、小结:把提示词变成习惯

提示词工程不是"背模板",而是"把清晰思考外显"的过程。坚持三条原则即可稳定进步:一是有验收标准(用样例说话,不靠感觉);二是结构先行(角色-任务-要求-示例-输入五段式);三是持续迭代(每次失败都转化为模板改进)。把成熟的提示词沉淀进团队模板库,让每个人都能站在前人的肩膀上稳定产出,这才是提示词工程的长期价值。

用户评价

  • 加载评价中...