あなたのGPU、あなたのプロジェクト KYC不要の暗号資産決済お支払い方法
日本語
マイページ
初めてのプロジェクトガイド

あなたのアシスタントに何ができるか決めるための20の質問。

最初のアシスタントを評価するには、まず狭い範囲のタスクを任せ、試す前に期待する回答を用意しておきましょう。同じ20の質問を固定の設定で投げかけ、使われた情報を確認し、正しい回答と根拠ある回答拒否を区別します。この小さなテストは誤りと次のアクションを特定するためのものであり、自律したサービスや一般的な品質を保証するものではありません。

このページ内

タスク、宛先、制限を決める

チームがよく知っている操作を選びましょう。手順を探す、議事録を要約する、下書きを用意するなどです。最初の成果物は、各質問、生の回答、期待される出典、人間による判定をまとめた表でよいでしょう。

情報が不足しているときの動作を定義しましょう。追加の確認を求めるのか、情報がないと伝えるのかです。その分野に詳しく、受け入れ可否を判断できる担当者を指名します。誰も回答を検証できない場合、テストから有用な結論は得られません。

質問を選ぶ前に文書を安定させる

必要な文書と許可された文書を準備します。重複を取り除き、有効な版を特定し、矛盾点を見つけます。各文書に識別子を付け、期待する箇所の位置を記録しておきましょう。

Transformersは、コンテキストから抽出した回答と、そのコンテキストに基づいて生成した回答を区別します。どちらの場合も、正しい箇所が実際に提供されたかを確認してください。ファイルをフォルダに入れたからといって、ソフトウェアがすべてを正しく読み込んだり選択したりしたわけではありません。

架空のコーパスと、すぐに試せる20の質問

機材貸し出しワークショップ向けの架空の演習です。PAとPBだけが情報源であり、BriefGPUのサービスとは関係ありません。これらをアシスタントに渡し、期待する回答を教えずに各質問を投げかけます。

PA — フォトキット。受け取りの少なくとも2日前までに、名前、受け取り日、返却日を記入してフォームを送信してください。Louiseが予約を確認します。キットにはカメラ1台とバッテリー2個が含まれます。受け取りと返却はカウンターA、月曜日から金曜日まで。受け取りは9時から12時まで、返却は17時より前です。返却時にスタッフが物品を数えます。

PB — オーディオキット。受け取りの少なくとも1日前までに、名前、受け取り日、返却日を記入してフォームを送信してください。Malikが予約を確認します。キットにはマイク1本とヘッドセット1つが含まれます。受け取りと返却はカウンターB、月曜日から金曜日まで。受け取りは14時から17時まで、返却は17時より前です。返却時にスタッフが物品を数えます。

質問1〜5は事実について、6〜10は手順を突き合わせ、11〜15は確認が必要で、16〜20は存在しない情報についてです。忠実な言い換えは受け入れます。出力を人間が修正することは、モデルの成功とは数えません。

架空のコーパスと、すぐに試せる20の質問
N°投げかける質問期待する回答または動作
1写真キットを確認するのは誰ですか?PAによると、Louiseです。
2写真キットには何が含まれますか?PAに従い、カメラ1台とバッテリー2個。
3音声キットはどこで受け取りますか?PBによると、カウンターBです。
4音声キットは何時までに返却する必要がありますか?PBによると、月曜から金曜の17時までです。
5写真キットの予約にはどの項目を記入しますか?PAによると、名、受け取り日、返却日です。
6両方のフォームは同じ情報を求めていますか?はい。PAとPBのどちらも、名と受け取り日・返却日です。
7より早めの申請が必要なキットはどちらですか?写真の場合:2暦日、音声の場合は1暦日。
8共通する確認と返却時間は何ですか?物品の数え上げ。月曜から金曜の17時までの返却。
9同じ人が両方の予約を確認しますか?いいえ。写真はLouise、音声はMalikです。
10火曜日の10時に、カウンターAで両方のキットを受け取れますか?いいえ。写真はAで9時から12時、音声はBで14時から17時です。
11キットの確認は誰に聞けばよいですか?写真キットか音声キットかを尋ねます。
12自分のキットはどのカウンターに行けばよいですか?どのキットかを尋ねます。
13火曜日の15時にキットを受け取れますか?キットを尋ねます。音声は可、写真は時間外です。
14自分のキットには何が入っているべきですか?列挙する前に、写真キットか音声キットかを尋ねます。
15金曜日にキットを受け取りたいのですが、前日までに申し込めば間に合いますか?キットを尋ねます。音声には十分、写真には不十分です。
16貸し出しの料金はいくらですか?コーパスには料金の記載がありません。
17返却が遅れた場合、どのようなペナルティが設けられていますか?ペナルティは文書化されていません。推測して記載しないでください。
18カメラの解像度はいくつですか?この特徴はPAに記載がありません。
19本人以外の人が機材を受け取ることはできますか?第三者による受け取りの可否は明記されていません。
20Louiseが不在のとき、誰が代わりを務めますか?代理の担当者は示されていません。

構成を決めて、1回の申請で始める

互換性のあるモデルとツールを選び、それぞれのバージョンとライセンスを記録します。指示、文書の選択、設定を書き留めます。Transformersでは、max_new_tokensが生成される新しいトークンを制限し、サンプリングが出力の選択に影響します。これらのパラメータを保持して、各実行を比較しましょう。

必要なメモリはモデルファイルだけではありません。作業データや生成キャッシュも容量を使用します。Transformersは、コンテキストが長くなるにつれてキャッシュのコストが増える点を特に説明しています。まず1回の申請で始めて、その後、最も長い入力で確認しましょう。

ユーザー数と応答の長さを同時に増やすと、品質とキャパシティが混ざってしまいます。24、48、80 GBという目安は、モデルや複数のリクエストが必ず収まると約束するものではありません。

実例:2つの手順、16件の受理された回答

上記の評価表を使って、2つの手順PAとPBを評価するとします。回答が受理されるのは、情報源と期待される動作に従っている場合です。したがって、確認を求めることも成功になり得ます。

この表は仮定のものです。作成にあたってモデルは一切実行していません。20件のうち16件が承認された場合、この特定の集合では80%になりますが、他のリクエストにおける信頼性を推定するものではありません。でっち上げたルールのほうが、不完全な回答よりも重く見られてしまうことがあります。

このシナリオでは、チームはまず捏造と曖昧さを検討します。記述が欠けている場合は選択の見直しが必要であり、記述はあるが誤って解釈されている場合は指示やモデルに原因があると考えられます。メモリを増やしても、こうした誤りが自動的に修正されるわけではありません。

実例:2つの手順、16件の受理された回答
カテゴリ、各5問承認要確認
単純な情報5この例ではなし。
照合作業4部分的な回答。
曖昧なリクエスト3根拠のない仮定と不要な拒否。
情報の欠落4作り上げたルール。
合計20件中16件未承認のケースが4件。

各判定を説明する記録を残す

生の回答、提供された記述、参照、判定とその理由を保管します。文書の選択ミス、誤った解釈、不適切な形式を区別しましょう。「モデルは時々間違える」では、どの修正も示せません。

次に、観測された所要時間と見直しの工数を評価し、初期の読み込みと後続の実行を分けて考えます。生成がばらつく場合は、いくつかの難しい質問を繰り返し、すべての出力を保管します。最も良いものだけを選ぶと失敗が見えなくなりますが、同じ入力の繰り返しでは実際のあらゆる状況を網羅できません。

  • 質問の識別子と正確な表現。
  • 文書のバージョンと実際に提供された記述。
  • 生の回答と表示された参照。
  • 人間による判定と短い理由。
  • 試行の構成と、時間やメモリに関する観察。

1つの変数を修正し、すでに機能していたものを確認する

文書、抜粋の選択、指示、モデルなど、特定できる1つの変数を変更します。失敗したケースと、すでに受理されたいくつかの質問を再実行します。修正によって別のケースが悪化することがあるため、以前の出力を保存しておけば確認できます。

評価表のすべての回答を組み込むまで指示を調整しないでください。その後、新しい質問をいくつか用意します。これにより、修正が既知の20件の表現を超えてニーズに応えられているかを確認できます。この確認は、あくまでその条件の範囲内にとどまります。

今後の進め方を決め、テスト記録を持ち帰る

明確な範囲で結論を出します。参照を見つける、見直し済みの下書きを作る、確認を求めるなどです。除外したケースを明記します。成功したデモは、会社全体で正しい回答を保証するものではありません。

監督付きの試行を続ける、特定の原因を修正する、または見直しのコストが当初の作業を上回る場合は中止します。複数の同時リクエストを行う前に、個々の流れを検証し、変化を確認するための既知のサブセットを保管しておきましょう。

許可されたドキュメント、判定基準、出力、設定、判断を保存します。レンタルは生成だけでなく、評価とリカバリをカバーする必要があります。BriefGPUはクライアントにツールと処理の選択を委ね、その内容を検査しません。結果の管理は引き続きお客様の責任です。

よくある質問

20の質問だけでアシスタントを認定するのに十分でしょうか?

いいえ。それらは既知の範囲における診断にすぎません。より広い用途には、別のケースと、誤りの影響に応じたチェックが必要です。

参照付きの回答は必ず正しいですか?

いいえ。引用された箇所が実在し、質問に関連し、回答を実際に裏付けているかを確認してください。関連する参照が、でっち上げられた主張に添えられていることもあります。

なぜ確認を求める応答を成功と数えるのですか?

曖昧な質問には確認が必要なことがあります。この望ましい挙動をテスト前に定義し、データが十分だったのに拒否した場合と区別してください。

この最初の試行でモデルを訓練すべきですか?

必ずしも必要ではありません。まずは互換性のあるモデルと、ツールに提供するドキュメントで始めてください。後からの訓練は、特定されたニーズに対して、そのデータと基準とともに応えるべきです。

自分のペースで進める

ちょっとした段取りで、スタートが変わります。

ガイドを見る