您的 GPU,您的项目 无需 KYC 的加密货币支付如何付款
简体中文
我的空间
首个项目指南

用二十个问题来确定你的助手能做什么。

要评估一个初级助手,先交给它一项范围明确的任务,并在测试前准备好预期答案。用固定配置提出同样的二十个问题,核对它使用了哪些信息,并区分正确答案与有依据的拒答。这个小测试用于发现错误和确定下一步行动;它既不能证明服务可以自主运行,也不能证明其整体质量。

本页内容

选定一项任务、一个使用者和一条界限

选择一项你团队熟悉的操作:查找某项流程、总结一份会议记录或准备一份草稿。第一份交付物可以是一个表格,汇总每个问题、原始回答、预期来源和人工判定。

明确规定信息缺失时的行为:是请求补充说明,还是提示信息不存在。指定一位了解该领域、并负责决定是否通过的人。如果没有人能核实回答,这个测试就无法得出有用的结论。

先整理好文档,再选择问题

准备好所需且已获授权的文档。删除重复项,确认现行版本,找出相互矛盾之处。给每份文档分配一个标识符,并记录预期段落所在的位置。

Transformers 区分从上下文中抽取的回答和基于该上下文生成的回答。无论哪种情况,都要核实是否确实提供了正确的段落。把文件放进文件夹,并不意味着软件已经全部读取或正确选取了它们。

一个虚构语料库和二十个待测试的问题

用于设备借用工作坊的虚构练习:PA 和 PB 是仅有的两个来源,与 BriefGPU 的服务无关。把它们提供给助手,然后逐个提问,不要告诉它预期答案。

PA——摄影套装。至少在取件前两个自然日发送表单,注明名字、取件日期和归还日期。由 Louise 确认预订。套装包含一台设备和两块电池。取件和归还均在 A 柜台,周一至周五:取件时间为 9 时至 12 时,归还时间在 17 时之前。归还时由工作人员清点物品。

PB——音频套装。至少在取件前一个自然日发送表单,注明名字、取件日期和归还日期。由 Malik 确认预订。套装包含一个麦克风和一个耳机。取件和归还均在 B 柜台,周一至周五:取件时间为 14 时至 17 时,归还时间在 17 时之前。归还时由工作人员清点物品。

第 1 至 5 题考查事实,第 6 至 10 题需要对照流程,第 11 至 15 题需要补充说明,第 16 至 20 题涉及不存在的信息。忠实改写视为正确。对输出进行人工修正不算模型成功。

一个虚构语料库和二十个待测试的问题
N°Question à poserRéponse ou comportement attendu
1摄影套装由谁确认?Louise,依据 PA。
2摄影套装包含什么?一台设备和两块电池,依据 PA。
3音频套装在哪里取件?在 B 柜台,依据 PB。
4音频套装最晚几点归还?周一至周五 17 时之前,依据 PB。
5预订摄影套装需要填写哪些字段?名字、取件日期和归还日期,依据 PA。
6两份表单要求的信息相同吗?相同:名字以及取件日期和归还日期,PA 和 PB 都如此。
7哪个套装需要更提前申请?摄影套装:需提前两个自然日,音频套装只需一天。
8有哪些共同的清点和归还时间要求?清点物品;周一至周五 17 时之前归还。
9两次预订是否由同一个人确认?不是:摄影套装由 Louise 确认,音频套装由 Malik 确认。
10周二 10 时,我可以在 A 柜台取这两个套装吗?不可以:摄影套装在 A 柜台 9 时至 12 时;音频套装在 B 柜台 14 时至 17 时。
11该向谁询问套装的确认情况?询问是摄影套装还是音频套装。
12我的套装该去哪个柜台?询问是哪个套装。
13我可以在周二 15 时取我的套装吗?询问是哪个套装:音频套装可以,摄影套装不在该时段内。
14我的套装里应该有什么?在列举之前,先询问是摄影套装还是音频套装。
15我想周五取一个套装:提前一天够吗?询问是哪个套装:音频套装时间足够,摄影套装不够。
16借用要多少钱?语料库中没有给出任何价格。
17延迟归还预计会有什么罚则?没有记录任何罚则;请勿自行编造。
18摄像头的分辨率是多少?PA 中没有这一特性。
19其他人可以代我取走设备吗?未说明是否可以由第三方代取。
20Louise 缺席时由谁代替她?没有指定任何替补人员。

用一次请求确定配置并开始使用

选择兼容的模型和工具,然后记录它们的版本和许可证。记下提示词、文档的选择以及各项设置。在 Transformers 中,max_new_tokens 限制生成的新 token 数量;采样会影响输出的选择。保留这些参数,以便比较各段结果。

所需内存不只有模型文件:工作数据和生成缓存也占用空间。Transformers 特别说明了上下文变长时缓存的成本。先以一次请求开始,然后检查最长的输入。

同时增加用户数和回答长度会把质量与容量混为一谈。24、48 或 80 GB 这些参考值并不保证某个模型或多条请求一定放得下。

完整示例:两项流程,十六个被接受的回答

假设用上面的评分表评估 PA 和 PB 两项流程。回答若符合来源和预期行为即被接受。因此请求补充说明也可能算成功。

该表格是假设的:没有运行任何模型来生成它。二十个用例中有十六个被接受,在这一组特定数据中为 80%,并不代表在其他请求上的可靠性。编造出的规则可能比不完整的回答影响更大。

在这种情况下,团队首先检查发明内容和模糊之处。缺失的段落需要重新审查其选取;段落存在但被错误解读,则指向提示词或模型。增加内存并不能自动纠正这些错误。

完整示例:两项流程,十六个被接受的回答
Famille, 5 questions chacuneAcceptéesÀ examiner
简单信息5本示例中没有。
对照检索4一个不完整的回答。
歧义请求3一个没有依据的假设和一次无谓的拒绝。
缺失信息4一条编造的规则。
合计20 个中 16 个4 个未被接受的用例。

保留一份能解释每个判定结果的记录

保留原始回答、所提供的段落、引用、判定结果及其理由。区分文档选错、理解错误和格式不当:“模型有时会出错”并没有指出任何具体的修正方向。

然后评估实际耗时和复核工作量,将初始加载与后续段落分开。如果生成结果不稳定,就重复几个困难的问题并保留所有输出。只挑最好的会掩盖失败;重复相同的输入也覆盖不了所有真实情况。

  • 问题的标识符和确切表述。
  • 文档版本和实际提供的段落。
  • 原始回答和所显示的引用。
  • 人工判定和简短理由。
  • 测试配置以及时长或内存方面的观察。

每次只改一个变量,然后检查原本正常的部分

只改动一个可识别的变量:文档、段落选择、提示词或模型。重跑失败的用例和几个已经通过的用例。一次修正可能让另一种情况变差;保留旧输出才能看出来。

不要一直调整提示词,直到把评分表里的所有回答都塞进去。之后再准备几个新问题:用来检验这次修正能否在已知的二十种表述之外满足需求。这种检验仍受限于其自身条件。

决定后续方向并带走测试记录

把结论限定在明确范围内:查找某个引用、准备一份待复核的草稿,或请求补充说明。列出被排除的情形。一次成功的演示并不能保证对整个公司都给出正确回答。

接下来可以开展有人监督的试用,修正某个具体原因,或者如果复核的成本高于原本的工作量就停下来。在同时处理多条请求之前,先验证单条流程,并保留一个已知的子集来观察变化。

保存获授权的文档、评分标准、输出结果、参数设置和决策。租用不仅要覆盖评估,还要覆盖恢复,而不只是生成。BriefGPU 把工具和处理方式的选择权交给客户,不检查其内容;你仍需对结果进行把控。

常见问题

二十个问题足以认证一个助手吗?

不能。它们只是在已知范围内的一次诊断。更大范围的使用需要更多用例,以及根据出错后果量身定制的检查。

带有引用的回答就一定正确吗?

不一定。请核实所引段落是否存在、是否切题、是否真正支撑该回答。一段贴切的引用可能伴随着一个凭空捏造的说法。

为什么要把请求澄清也算作成功?

含糊的问题有时确实需要澄清。请在测试前就定义好这种预期行为,并将它与在数据已充足时的拒绝区分开来。

这次初次试用需要训练模型吗?

不一定。可以先用兼容的模型和提供给工具使用的文档起步。之后的训练应当针对已明确的需求,并配备相应的数据和标准。

按你的节奏推进

讲点方法,起步更轻松。

打开指南