Ihre GPU, Ihr Projekt Krypto-Zahlung ohne KYCSo bezahlen Sie
Deutsch
Mein Bereich
Leitfaden für das erste Projekt

Zwanzig Fragen, um zu entscheiden, was Ihr Assistent leisten kann.

Um einen ersten Assistenten zu bewerten, vertrauen Sie ihm eine eng umrissene Aufgabe an und legen Sie die erwarteten Antworten schon vor dem Test fest. Stellen Sie dieselben zwanzig Fragen mit einer festen Konfiguration, prüfen Sie die verwendeten Informationen und unterscheiden Sie eine korrekte Antwort von einer begründeten Enthaltung. Dieser kleine Test dient dazu, Fehler und den nächsten Schritt zu erkennen; er bescheinigt weder einen autonomen Dienst noch eine allgemeine Qualität.

Auf dieser Seite

Aufgabe, Empfänger und Grenze festlegen

Wählen Sie eine Aktion, die Ihr Team kennt: eine Prozedur wiederfinden, einen Bericht zusammenfassen oder einen Entwurf vorbereiten. Das erste Ergebnis kann eine Tabelle sein, die jede Frage, die Rohantwort, die erwartete Quelle und das menschliche Urteil zusammenführt.

Legen Sie das Verhalten fest, wenn die Information fehlt: nach einer Präzisierung fragen oder eine Lücke melden. Benennen Sie eine Person, die das Fachgebiet kennt und über die Abnahme entscheidet. Wenn niemand die Antworten überprüfen kann, lässt der Test keinen sinnvollen Schluss zu.

Die Dokumente stabilisieren, bevor man die Fragen auswählt

Bereiten Sie die nötigen und zulässigen Dokumente vor. Entfernen Sie Duplikate, identifizieren Sie die gültigen Versionen und finden Sie Widersprüche. Geben Sie jedem Dokument eine Kennung und halten Sie die Fundstellen der erwarteten Passagen fest.

Transformers unterscheidet die aus dem Kontext extrahierte Antwort von der anhand dieses Kontexts generierten Antwort. Prüfen Sie in beiden Fällen, ob die richtige Passage tatsächlich bereitgestellt wurde. Dateien in einen Ordner zu legen bedeutet nicht, dass die Software sie alle gelesen oder korrekt ausgewählt hat.

Ein fiktives Korpus und zwanzig bereitstehende Testfragen

Fiktive Übung für einen Workshop zur Materialausleihe: PA und PB sind die einzigen Quellen, ohne Bezug zu den Diensten von BriefGPU. Stellen Sie sie dem Assistenten bereit und stellen Sie jede Frage, ohne ihm die erwarteten Antworten zu geben.

PA — Fotokit. Das Formular mindestens zwei Kalendertage vor der Abholung senden, mit Vorname, Abholdatum und Rückgabedatum. Louise bestätigt die Reservierung. Das Kit enthält eine Kamera und zwei Akkus. Abholung und Rückgabe am Schalter A, von Montag bis Freitag: Abholung von 9 bis 12 Uhr, Rückgabe vor 17 Uhr. Das Personal zählt die Teile bei der Rückgabe.

PB — Audiokit. Das Formular mindestens einen Kalendertag vor der Abholung senden, mit Vorname, Abholdatum und Rückgabedatum. Malik bestätigt die Reservierung. Das Kit enthält ein Mikrofon und einen Kopfhörer. Abholung und Rückgabe am Schalter B, von Montag bis Freitag: Abholung von 14 bis 17 Uhr, Rückgabe vor 17 Uhr. Das Personal zählt die Teile bei der Rückgabe.

Die Fragen 1 bis 5 betreffen einen Fakt, 6 bis 10 stellen die Verfahren gegenüber, 11 bis 15 erfordern eine Präzisierung und 16 bis 20 betreffen eine fehlende Information. Akzeptieren Sie eine sinngemäße Umformulierung. Eine menschliche Korrektur der Ausgabe zählt nicht als Erfolg des Modells.

Ein fiktives Korpus und zwanzig bereitstehende Testfragen
N°Zu stellende FrageErwartete Antwort oder erwartetes Verhalten
1Wer bestätigt das Fotokit?Louise, laut PA.
2Was enthält das Fotokit?Eine Kamera und zwei Akkus, laut PA.
3Wo holt man das Audiokit ab?Am Schalter B, laut PB.
4Bis wann muss das Audiokit zurückgegeben werden?Vor 17 Uhr, von Montag bis Freitag, laut PB.
5Welche Felder sind zum Reservieren des Fotokits auszufüllen?Vorname, Abholdatum und Rückgabedatum, laut PA.
6Verlangen beide Formulare dieselben Informationen?Ja: Vorname sowie Abhol- und Rückgabedatum, in PA und PB.
7Welches Kit erfordert eine frühere Anfrage?Das Fotokit: zwei Kalendertage gegenüber einem beim Audiokit.
8Welche Kontrollen und Rückgabezeiten sind gemeinsam?Zählung der Teile; Rückgabe vor 17 Uhr, von Montag bis Freitag.
9Bestätigt dieselbe Person beide Reservierungen?Nein: Louise für das Fotokit, Malik für das Audiokit.
10Kann ich an einem Dienstag um 10 Uhr beide Kits am Schalter A abholen?Nein: Fotokit in A von 9 bis 12 Uhr; Audiokit in B von 14 bis 17 Uhr.
11Wen soll man um die Bestätigung des Kits bitten?Nachfragen, ob es sich um das Foto- oder das Audiokit handelt.
12Zu welchem Schalter muss ich für mein Kit gehen?Nachfragen, welches Kit gemeint ist.
13Kann ich mein Kit am Dienstag um 15 Uhr abholen?Nach dem Kit fragen: Audiokit ja, Fotokit außerhalb des Zeitfensters.
14Was muss mein Kit enthalten?Nachfragen, ob es sich um das Foto- oder das Audiokit handelt, bevor man aufzählt.
15Ich möchte ein Kit am Freitag abholen: reicht ein Tag Vorlauf?Nach dem Kit fragen: ausreichender Vorlauf für das Audiokit, nicht für das Fotokit.
16Wie hoch ist der Preis für die Ausleihe?Das Korpus nennt keinen Preis.
17Welche Strafe ist bei einer verspäteten Rückgabe vorgesehen?Es ist keine Strafe dokumentiert; erfinden Sie keine.
18Wie hoch ist die Auflösung der Kamera?Dieses Merkmal fehlt in PA.
19Kann eine andere Person das Material an meiner Stelle abholen?Die Möglichkeit der Abholung durch Dritte ist nicht angegeben.
20Wer vertritt Louise, wenn sie abwesend ist?Es ist keine Vertretung angegeben.

Die Konfiguration festlegen und mit einer einzigen Anfrage starten

Wählen Sie ein kompatibles Modell und Werkzeug und notieren Sie deren Versionen und Lizenz. Halten Sie die Anweisung, die Dokumentauswahl und die Einstellungen fest. In Transformers begrenzt max_new_tokens die neu erzeugten Tokens; die Stichprobenentnahme beeinflusst die Auswahl der Ausgabe. Behalten Sie diese Parameter bei, um die Durchläufe zu vergleichen.

Der benötigte Speicher umfasst mehr als die Modelldatei: Auch Arbeitsdaten und der Generierungs-Cache belegen Platz. Transformers beschreibt insbesondere die Kosten des Caches, wenn der Kontext länger wird. Beginnen Sie mit einer einzigen Anfrage und prüfen Sie anschließend die längsten Eingaben.

Nutzerzahl und Antwortlänge gleichzeitig zu erhöhen, würde Qualität und Kapazität vermischen. Die Richtwerte von 24, 48 oder 80 GB versprechen nicht, dass ein Modell oder mehrere Anfragen hineinpassen.

Durchgerechnetes Beispiel: zwei Verfahren, sechzehn akzeptierte Antworten

Angenommen, es werden die beiden Verfahren PA und PB anhand der obigen Tabelle bewertet. Eine Antwort wird akzeptiert, wenn sie die Quelle und das erwartete Verhalten einhält. Um eine Präzisierung zu bitten, kann daher ein Erfolg sein.

Die Tabelle ist hypothetisch: Es wurde kein Modell ausgeführt, um sie zu erstellen. Sechzehn akzeptierte Fälle von zwanzig ergeben 80 % in genau diesem Satz, ohne die Zuverlässigkeit bei anderen Anfragen zu schätzen. Eine erfundene Regel kann stärker ins Gewicht fallen als eine unvollständige Antwort.

In diesem Szenario prüft das Team zuerst die Erfindung und die Mehrdeutigkeiten. Ein fehlender Abschnitt erfordert eine Überprüfung der Auswahl; ein vorhandener, aber falsch interpretierter Abschnitt weist auf die Anweisung oder das Modell hin. Mehr Speicher behebt diese Fehler nicht automatisch.

Durchgerechnetes Beispiel: zwei Verfahren, sechzehn akzeptierte Antworten
Familie, je 5 FragenAkzeptiertZu prüfen
Einfache Informationen5Keine in diesem Beispiel.
Verknüpfungen4Eine teilweise Antwort.
Mehrdeutige Anfragen3Eine ungerechtfertigte Annahme und eine unnötige Ablehnung.
Fehlende Informationen4Eine erfundene Regel.
Gesamt16 von 204 nicht akzeptierte Fälle.

Eine Spur bewahren, die jedes Urteil erklärt

Bewahren Sie die Rohantwort, die bereitgestellten Abschnitte, die Referenzen, das Urteil und dessen Begründung auf. Unterscheiden Sie falsch gewähltes Dokument, fehlerhafte Interpretation und unpassende Form: „Das Modell irrt sich manchmal“ benennt keine Korrektur.

Bewerten Sie anschließend die beobachtete Dauer und den Aufwand für die Überprüfung, wobei Sie das anfängliche Laden und die nachfolgenden Abschnitte getrennt betrachten. Wenn die Generierung variiert, wiederholen Sie einige schwierige Fragen und behalten Sie alle Ausgaben. Nur die beste auszuwählen, würde die Fehlschläge verbergen; dieselben Eingaben zu wiederholen, deckt nicht alle realen Situationen ab.

  • Kennung und genauer Wortlaut der Frage.
  • Version des Dossiers und tatsächlich bereitgestellte Abschnitte.
  • Rohantwort und angezeigte Referenzen.
  • Menschliches Urteil und kurze Begründung.
  • Konfiguration des Versuchs und Beobachtungen zu Dauer oder Speicher.

Eine Variable korrigieren und dann prüfen, was bereits funktioniert hat

Ändern Sie eine eindeutig identifizierbare Variable: Dokument, Abschnittsauswahl, Anweisung oder Modell. Spielen Sie die Fehlschläge und mehrere bereits akzeptierte Fragen erneut durch. Eine Korrektur kann einen anderen Fall verschlechtern; bewahren Sie die alten Ausgaben auf, um das zu erkennen.

Passen Sie die Anweisung nicht so lange an, bis alle Antworten der Tabelle darin enthalten sind. Bereiten Sie anschließend einige neue Fragen vor: Sie prüfen, ob die Korrektur den Bedarf über die zwanzig bekannten Formulierungen hinaus erfüllt. Diese Kontrolle bleibt auf ihre eigenen Bedingungen beschränkt.

Über das weitere Vorgehen entscheiden und das Testdossier mitnehmen

Schließen Sie mit einem präzisen Umfang ab: eine Referenz finden, einen überprüften Entwurf vorbereiten oder um eine Präzisierung bitten. Benennen Sie die ausgeschlossenen Fälle. Eine erfolgreiche Demonstration garantiert keine korrekten Antworten für das gesamte Unternehmen.

Fahren Sie mit einem beaufsichtigten Versuch fort, beheben Sie eine konkrete Ursache oder brechen Sie ab, wenn die Überprüfung mehr kostet als die ursprüngliche Arbeit. Bevor Sie mehrere gleichzeitige Anfragen stellen, validieren Sie den individuellen Ablauf und bewahren Sie eine bekannte Teilmenge auf, um die Änderungen festzustellen.

Sichern Sie autorisierte Dokumente, Bewertungsraster, Ergebnisse, Einstellungen und Entscheidung. Die Miete muss die Bewertung und die Wiederaufnahme abdecken, über die Generierung hinaus. BriefGPU überlässt die Wahl der Werkzeuge und Verarbeitungen dem Kunden, ohne den Inhalt zu prüfen; Ihre Kontrolle der Ergebnisse bleibt erforderlich.

Häufige Fragen

Reichen zwanzig Fragen aus, um einen Assistenten zu zertifizieren?

Nein. Sie bilden eine Diagnose auf einem bekannten Umfang. Eine breitere Nutzung verlangt weitere Fälle und Kontrollen, die den Folgen eines Fehlers angepasst sind.

Ist eine Antwort mit einer Referenz zwangsläufig korrekt?

Nein. Prüfen Sie, ob die zitierte Stelle existiert, sich auf die Frage bezieht und die Antwort tatsächlich stützt. Eine passende Referenz kann eine erfundene Aussage begleiten.

Warum zählt eine Rückfrage nach Präzisierung als Erfolg?

Eine mehrdeutige Frage erfordert manchmal eine Präzisierung. Legen Sie dieses erwartete Verhalten vor dem Test fest und unterscheiden Sie es von einer Ablehnung, obwohl die Daten ausreichten.

Muss man für diesen ersten Versuch ein Modell trainieren?

Nicht unbedingt. Beginnen Sie mit einem kompatiblen Modell und Dokumenten, die dem Werkzeug bereitgestellt werden. Ein späteres Training muss einem identifizierten Bedarf entsprechen, mit eigenen Daten und Kriterien.

Kommen Sie in Ihrem Tempo voran

Ein wenig Methode verändert den Start.

Guides öffnen