Twój GPU, Twój projekt Płatność krypto bez KYCJak zapłacić
Polski
Moje konto
Przewodnik po pierwszym projekcie

Dwadzieścia pytań, by zdecydować, co potrafi twój asystent.

Aby ocenić pierwszego asystenta, powierz mu wąskie zadanie i przygotuj oczekiwane odpowiedzi przed próbą. Zadaj te same dwadzieścia pytań przy stałej konfiguracji, sprawdź wykorzystane informacje i odróżnij poprawną odpowiedź od uzasadnionej odmowy. Ten mały test służy do zidentyfikowania błędów i następnego kroku; nie potwierdza ani samodzielnego działania usługi, ani ogólnej jakości.

Na tej stronie

Wybierz zadanie, odbiorcę i limit

Wybierz działanie znane Twojemu zespołowi: znalezienie procedury, streszczenie protokołu lub przygotowanie szkicu. Pierwszym rezultatem może być tabela łącząca każde pytanie, surową odpowiedź, oczekiwane źródło i ocenę człowieka.

Określ zachowanie, gdy brakuje informacji: poproszenie o doprecyzowanie lub zgłoszenie braku. Wyznacz osobę, która zna dziedzinę i zdecyduje o akceptacji. Jeśli nikt nie może zweryfikować odpowiedzi, test nie pozwala wyciągnąć użytecznych wniosków.

Uporządkuj dokumenty, zanim wybierzesz pytania

Przygotuj potrzebne i dozwolone dokumenty. Usuń duplikaty, zidentyfikuj obowiązujące wersje i znajdź sprzeczności. Nadaj każdemu dokumentowi identyfikator i zapisz położenie oczekiwanych fragmentów.

Transformers rozróżnia odpowiedź wyodrębnioną z kontekstu od odpowiedzi wygenerowanej na podstawie tego kontekstu. W obu przypadkach sprawdź, czy właściwy fragment rzeczywiście został dostarczony. Umieszczenie plików w folderze nie oznacza, że oprogramowanie przeczytało je wszystkie lub wybrało je poprawnie.

Fikcyjny zbiór i dwadzieścia pytań gotowych do testu

Ćwiczenie fikcyjne na warsztat wypożyczania sprzętu: PA i PB to jedyne źródła, niezwiązane z usługami BriefGPU. Przekaż je asystentowi i zadaj każde pytanie, nie podając mu oczekiwanych odpowiedzi.

PA — Zestaw fotograficzny. Wyślij formularz co najmniej dwa dni kalendarzowe przed odbiorem, podając imię, datę odbioru i datę zwrotu. Louise potwierdza rezerwację. Zestaw zawiera aparat i dwie baterie. Odbiór i zwrot przy stanowisku A, od poniedziałku do piątku: odbiór od 9:00 do 12:00, zwrot przed 17:00. Personel liczy elementy przy zwrocie.

PB — Zestaw audio. Wyślij formularz co najmniej jeden dzień kalendarzowy przed odbiorem, podając imię, datę odbioru i datę zwrotu. Malik potwierdza rezerwację. Zestaw zawiera mikrofon i słuchawki. Odbiór i zwrot przy stanowisku B, od poniedziałku do piątku: odbiór od 14:00 do 17:00, zwrot przed 17:00. Personel liczy elementy przy zwrocie.

Pytania od 1 do 5 dotyczą faktu, od 6 do 10 zestawiają procedury, od 11 do 15 wymagają doprecyzowania, a od 16 do 20 dotyczą informacji nieobecnej. Zaakceptuj wierne przeformułowanie. Poprawa wyniku przez człowieka nie liczy się jako sukces modelu.

Fikcyjny zbiór i dwadzieścia pytań gotowych do testu
N°Pytanie do zadaniaOczekiwana odpowiedź lub zachowanie
1Kto potwierdza zestaw fotograficzny?Louise, zgodnie z PA.
2Co zawiera zestaw fotograficzny?Aparat i dwie baterie, zgodnie z PA.
3Gdzie odbiera się zestaw audio?Przy stanowisku B, zgodnie z PB.
4O której godzinie trzeba zwrócić zestaw audio?Przed 17:00, od poniedziałku do piątku, zgodnie z PB.
5Jakie pola należy wypełnić, aby zarezerwować zestaw fotograficzny?Imię, data odbioru i data zwrotu, zgodnie z PA.
6Czy oba formularze wymagają tych samych informacji?Tak: imię oraz daty odbioru i zwrotu, w PA i PB.
7Który zestaw wymaga wcześniejszego zgłoszenia?Fotograficzny: dwa dni kalendarzowe, w porównaniu z jednym dla audio.
8Jakie kontrole i godziny zwrotu są wspólne?Liczenie elementów; zwrot przed 17:00, od poniedziałku do piątku.
9Czy ta sama osoba potwierdza obie rezerwacje?Nie: Louise dla fotograficznego, Malik dla audio.
10We wtorek o 10:00, czy mogę odebrać oba zestawy przy stanowisku A?Nie: foto przy A od 9:00 do 12:00; audio przy B od 14:00 do 17:00.
11Kogo zapytać o potwierdzenie zestawu?Zapytać, czy chodzi o zestaw fotograficzny, czy audio.
12Do którego stanowiska mam się udać po swój zestaw?Zapytać, którego zestawu to dotyczy.
13Czy mogę odebrać swój zestaw we wtorek o 15:00?Zapytać o zestaw: audio tak, fotograficzny poza przedziałem czasowym.
14Co powinien zawierać mój zestaw?Zapytać, czy chodzi o zestaw fotograficzny, czy audio, zanim się je wymieni.
15Chcę odebrać zestaw w piątek: czy jeden dzień wcześniej wystarczy?Zapytać o zestaw: termin wystarczający dla audio, niewystarczający dla fotograficznego.
16Jaka jest cena wypożyczenia?Zbiór nie podaje żadnej ceny.
17Jaka kara jest przewidziana za późny zwrot?Nie udokumentowano żadnej kary; nie wymyślaj jej.
18Jaka jest rozdzielczość aparatu?Tej cechy nie ma w PA.
19Czy inna osoba może odebrać sprzęt za mnie?Możliwość odbioru przez osobę trzecią nie jest określona.
20Kto zastępuje Louise, gdy jest nieobecna?Nie wskazano żadnego zastępcy.

Ustal konfigurację i zacznij od jednego zapytania

Wybierz kompatybilny model i narzędzie, a następnie zapisz ich wersje i licencję. Zanotuj polecenie, wybór dokumentów i ustawienia. W Transformers parametr max_new_tokens ogranicza liczbę generowanych nowych tokenów, a próbkowanie wpływa na wybór wyniku. Zachowaj te parametry, aby porównać fragmenty.

Potrzebna pamięć to więcej niż sam plik modelu: dane robocze i pamięć podręczna generowania również zajmują miejsce. Transformers opisuje między innymi koszt pamięci podręcznej, gdy kontekst się wydłuża. Zacznij od jednego zapytania, a potem sprawdź najdłuższe dane wejściowe.

Jednoczesne zwiększanie liczby użytkowników i długości odpowiedzi mieszałoby jakość z wydajnością. Progi 24, 48 czy 80 GB nie gwarantują, że zmieści się w nich jeden model lub kilka zapytań.

Przykład przeanalizowany: dwie procedury, szesnaście zaakceptowanych odpowiedzi

Załóżmy ocenę dwóch procedur PA i PB za pomocą powyższej tabeli. Odpowiedź jest zaakceptowana, jeśli jest zgodna ze źródłem i oczekiwanym zachowaniem. Poproszenie o doprecyzowanie może więc być sukcesem.

Tabela jest hipotetyczna: nie uruchomiono żadnego modelu, aby ją utworzyć. Szesnaście zaakceptowanych przypadków na dwadzieścia daje 80% w tym konkretnym zbiorze, bez szacowania niezawodności na innych zapytaniach. Wymyślona reguła może ważyć więcej niż niepełna odpowiedź.

W tym scenariuszu zespół najpierw analizuje konfabulacje i niejednoznaczności. Brakujący fragment wymaga ponownego przejrzenia jego wyboru; fragment obecny, ale błędnie zinterpretowany, kieruje ku poleceniu lub modelowi. Więcej pamięci nie naprawia automatycznie tych błędów.

Przykład przeanalizowany: dwie procedury, szesnaście zaakceptowanych odpowiedzi
Kategoria, po 5 pytań każdaZaakceptowaneDo sprawdzenia
Proste informacje5Żadna w tym przykładzie.
Zestawienia4Jedna częściowa odpowiedź.
Niejednoznaczne pytania3Jedno nieuzasadnione założenie i jedna niepotrzebna odmowa.
Brakujące informacje4Jedna wymyślona reguła.
Razem16 na 204 niezaakceptowane przypadki.

Zachowaj ślad, który wyjaśnia każdy werdykt

Zachowaj surową odpowiedź, dostarczone fragmenty, odwołania, werdykt i jego uzasadnienie. Rozróżnij źle wybrany dokument, błędną interpretację i nieodpowiednią formę: „model czasem się myli” nie wskazuje żadnej poprawki.

Następnie oceń zaobserwowany czas i nakład pracy przy weryfikacji, oddzielając wstępne ładowanie od kolejnych fragmentów. Jeśli generowanie jest zmienne, powtórz kilka trudnych pytań i zachowaj wszystkie wyniki. Wybór tylko najlepszego maskowałby porażki; powtarzanie tych samych danych wejściowych nie obejmuje wszystkich rzeczywistych sytuacji.

  • Identyfikator i dokładne sformułowanie pytania.
  • Wersja zestawu dokumentów i faktycznie dostarczone fragmenty.
  • Surowa odpowiedź i wyświetlone odwołania.
  • Werdykt człowieka i krótkie uzasadnienie.
  • Konfiguracja testu oraz obserwacje dotyczące czasu lub pamięci.

Zmień jedną zmienną, a potem sprawdź, co już działało

Zmień jedną możliwą do zidentyfikowania zmienną: dokument, wybór fragmentu, polecenie lub model. Powtórz niepowodzenia i kilka już zaakceptowanych pytań. Poprawka może pogorszyć inny przypadek; zachowaj stare wyniki, aby to zobaczyć.

Nie dostosowuj polecenia tak długo, aż włączysz do niego wszystkie odpowiedzi z tabeli. Przygotuj następnie kilka nowych pytań: sprawdzają one, czy poprawka służy potrzebie poza znanymi dwudziestoma sformułowaniami. Ta kontrola pozostaje ograniczona do własnych warunków.

Zdecyduj o dalszych krokach i zabierz ze sobą dossier testowe

Podsumuj w konkretnym zakresie: odnaleźć odwołanie, przygotować sprawdzony szkic lub poprosić o doprecyzowanie. Wymień wykluczone przypadki. Udana demonstracja nie gwarantuje poprawnych odpowiedzi dla całej firmy.

Kontynuuj nadzorowany test, napraw jedną konkretną przyczynę lub przerwij, jeśli weryfikacja kosztuje więcej niż praca początkowa. Przed uruchomieniem wielu jednoczesnych zapytań zatwierdź ścieżkę pojedynczą i zachowaj znany podzbiór, aby dostrzec zmiany.

Zapisuj autoryzowane dokumenty, siatkę, wyniki, ustawienia i decyzję. Wynajem musi obejmować ocenę i odzyskiwanie, wykraczające poza generowanie. BriefGPU pozostawia wybór narzędzi i przetwarzania klientowi, bez wglądu w ich treść; Twoja kontrola wyników pozostaje konieczna.

Częste pytania

Czy dwadzieścia pytań wystarczy, by certyfikować asystenta?

Nie. Stanowią one diagnozę w znanym zakresie. Szersze zastosowanie wymaga innych przypadków i kontroli dostosowanych do konsekwencji błędu.

Czy odpowiedź z odnośnikiem jest zawsze poprawna?

Nie. Sprawdź, czy cytowany fragment istnieje, dotyczy pytania i rzeczywiście potwierdza odpowiedź. Trafny odnośnik może towarzyszyć wymyślonemu twierdzeniu.

Dlaczego prośbę o doprecyzowanie liczyć jako sukces?

Nieprecyzyjne pytanie czasem wymaga doprecyzowania. Zdefiniuj to oczekiwane zachowanie przed testem i odróżnij je od odmowy, gdy danych było wystarczająco.

Czy trzeba trenować model na potrzeby tego pierwszego testu?

Niekoniecznie. Zacznij od zgodnego modelu i dokumentów dostarczonych narzędziu. Późniejszy trening musi odpowiadać zidentyfikowanej potrzebie, wraz z jego danymi i kryteriami.

Działaj we własnym tempie

Odrobina metody na dobry start.

Otwórz przewodniki