Inżynieria kontekstu LLM: Prompty, wyszukiwanie i RAG

Kontroluj, co widzi model i jak proces wykorzystuje te informacje.

Dowiedz się, jak role, przykłady, łańcuchy promptów, wyszukane dokumenty, RAG, agenci, temperatura i ustawienia dekodowania kształtują powtarzalny proces z LLM. Ten poradnik skupia się na kontekście i kontroli; następny poziom wyjaśnia architekturę stojącą pod spodem.

Na czym polega promptowanie rolą

Promptowanie rolą polega na poproszeniu modelu, aby odpowiadał z określonej perspektywy zawodowej. Rola powinna być związana z zadaniem, a nie teatralna. „Działaj jako starszy menedżer operacyjny ds. wsparcia” jest użyteczne przy pracy ze zgłoszeniami; „działaj jak geniusz” zwykle niewiele wnosi.

Przykład: Dla szablonu odpowiedzi helpdesku: „Działaj jako osoba odpowiedzialna za jakość wsparcia. Przeredaguj tę odpowiedź tak, aby była krótsza, cieplejsza i zgodna z zasadami. Nie zmieniaj warunku zwrotu pieniędzy”.
Porównanie tworzenia promptów z instrukcją roli i bez niej.
Promptowanie rolą nadaje modelowi perspektywę, ton i poziom szczegółowości jeszcze przed wykonaniem zadania.

Na czym polega few-shot prompting

Few-shot prompting oznacza podanie kilku przykładów danych wejściowych i oczekiwanego wyniku. Jest szczególnie przydatny, gdy format, ton lub granice klasyfikacji trudno opisać słowami. Dwa do pięciu trafnych przykładów często działa lepiej niż długie, abstrakcyjne wyjaśnienie.

Przykład: Zespół produktowy podaje trzy przykłady nieuporządkowanych próśb o funkcje i odpowiadający im oczyszczony format zgłoszeń Jira, a następnie prosi model o przekształcenie kolejnej prośby w tę samą strukturę.
Schemat pokazujący, jak przykłady ukierunkowują LLM przed wykonaniem właściwego zadania.
Few-shot prompting pokazuje modelowi oczekiwany wzorzec za pomocą przykładów.

Na czym polega łączenie promptów

Łączenie promptów dzieli złożone zadanie na mniejsze etapy. Zamiast prosić jednocześnie o wyszukanie informacji, konspekt, wersję roboczą, krytykę i wersję końcową, uruchamiasz sekwencję: wyodrębnij fakty, utwórz strukturę, napisz szkic, oceń, popraw. Daje to większą kontrolę i ułatwia wychwytywanie błędów.

Przykład: Dla landing page: krok 1 — streść problemy klientów. Krok 2 — utwórz konspekt strony. Krok 3 — napisz sekcje. Krok 4 — oceń je według kryteriów konwersji. Krok 5 — przygotuj ostateczny tekst.
Schemat łączenia promptów krok po kroku: wyszukiwanie informacji, organizacja, szkic i dopracowanie.
Łączenie promptów rozbija jedno złożone zadanie na mniejsze kroki, w których wynik jednego staje się wejściem kolejnego promptu.
Zbuduj powtarzalny proces

Łącz techniki tworzenia promptów w systemy, które można testować, ulepszać, zasilać wyszukanymi informacjami i ponownie wykorzystywać.

Mocniejszy pomysł: zaprojektuj system operacyjny dla promptów

Przy powtarzalnej pracy najlepszym promptem rzadko jest jedno sprytne zdanie. Potraktuj go jak mały system operacyjny: rola, dane wejściowe, zasady dotyczące źródeł, poziom jakości, format wyniku i etap kontroli. Dzięki temu łatwiej nauczyć innych tego procesu i łatwiej go debugować.

Jednorazowy prompt

„Napisz nasz e-mail onboardingowy”. Model zgaduje odbiorców, ton, szczegóły produktu i kryteria sukcesu.

System operacyjny dla promptów

„Użyj poniższych informacji o segmencie klientów, obietnicy produktu, przewodniku po tonie, zakazanych twierdzeniach, przykładowych e-mailach i liście kontrolnej. Przygotuj szkic, sam go sprawdź, a następnie zwróć końcową wersję e-maila”.

Praktyczny przykład: zespół wsparcia SaaS może połączyć etapy: sklasyfikuj zgłoszenie → wyszukaj odpowiednią zasadę → przygotuj odpowiedź → sprawdź niepoparte twierdzenia → przygotuj końcową odpowiedź. Każdy krok ma węższe zadanie, więc błędy łatwiej znaleźć.

Na czym polega inżynieria kontekstu

Inżynieria kontekstu to dyscyplina polegająca na decydowaniu, jakie informacje powinny trafić do modelu i w którym momencie. Obejmuje wybór źródeł, hierarchię instrukcji, pamięć, wyszukiwanie, przykłady, narzędzia i schematy wyników. Celem nie jest „maksymalny kontekst”, lecz najmniejszy niezawodny kontekst.

Przykład: Asystent prawny powinien otrzymać odpowiedni zapis, jurysdykcję, pytanie użytkownika i ograniczenia wyniku — a nie cały 80-stronicowy kontrakt przy każdej drobnej odpowiedzi.

Jak testować prompty

Testowanie promptów polega na wykonywaniu tego samego zadania na reprezentatywnych przykładach i ocenianiu wyników. Użyj kryteriów: poprawność, kompletność, zgodność z formatem, ton, bezpieczeństwo i czas potrzebny na edycję. Zachowaj mały zestaw regresyjny, aby zauważyć, gdy zmiana promptu poprawia jeden przypadek, ale psuje inny.

Przykład: Przetestuj 20 zgłoszeń wsparcia z trzema wariantami promptu. Oceń każdą odpowiedź w skali 1–5 pod względem zgodności z zasadami i zaoszczędzonego czasu. Najlepszy prompt nie zawsze jest najdłuższy.

Jak uzyskiwać lepsze odpowiedzi AI

Lepsze odpowiedzi zwykle wynikają z jaśniejszych celów, lepszego kontekstu, wyraźnych ograniczeń, przykładów i etapu kontroli. Poproś model o wskazanie założeń, użycie określonego formatu i zaznaczenie niepewności. W przypadku ważnych faktów dostarcz źródła albo wymagaj cytowań z wyszukanych materiałów.

Przykład: Zamiast „przeanalizuj to” poproś: „Znajdź trzy założenia o najwyższym ryzyku w tym planie wdrożenia, wyjaśnij, dlaczego każde z nich ma znaczenie, i podaj jeden test, który możemy przeprowadzić w tym tygodniu”.

RAG — proste wyjaśnienie

RAG oznacza generowanie wspomagane wyszukiwaniem. System najpierw przeszukuje bazę wiedzy, następnie przekazuje modelowi odpowiednie fragmenty, a model tworzy odpowiedź opartą na tych materiałach. RAG jest przydatny, gdy odpowiedzi zależą od prywatnych, zmieniających się lub bardzo obszernych dokumentów. Nie jest potrzebny przy prostych zadaniach pisarskich.

Przykład: Bot wsparcia SaaS wyszukuje najnowszy akapit polityki zwrotów przed przygotowaniem odpowiedzi, dzięki czemu nie polega na pamięci ani nieaktualnych przykładach.
Prosty przepływ RAG od pytania użytkownika przez wyszukany kontekst do wygenerowanej odpowiedzi.
RAG najpierw wyszukuje pomocne informacje, a następnie model odpowiada z wykorzystaniem tego kontekstu.

Czym są agenci AI?

Do tej pory pisałeś prompty, które zwracają jedną odpowiedź. Agent AI idzie o krok dalej: może zaplanować kilka etapów, korzystać z narzędzi (takich jak wyszukiwarka czy kalkulator), sprawdzać wynik i decydować, co zrobić dalej — powtarzając to aż do wykonania zadania. To różnica podobna do proszenia kogoś o wskazanie drogi i przekazania mu kluczy, aby sam załatwił sprawę.

Agenci są przydatni w wieloetapowych zadaniach, które w przeciwnym razie wymagałyby wielu osobnych promptów: wyszukiwanie informacji na kilku stronach, a potem streszczenie; albo wyszukanie informacji i przygotowanie odpowiedzi na jej podstawie. Ceną jest mniejsza kontrola — ponieważ agent działa samodzielnie, trzeba wyznaczyć wyraźniejsze granice i często dodać etap akceptacji przed wykonaniem ważnych działań. Jeśli chcesz poznać techniczne szczegóły działania agentów, narzędzi i Large Action Models, poradnik zaawansowany omawia je szczegółowo.

Przykład: „Znajdź trzy najnowsze artykuły na ten temat, a następnie napisz krótkie podsumowanie z linkami” to dobre pierwsze zadanie dla agenta — ograniczone, możliwe do sprawdzenia i niskiego ryzyka.

Temperatura — proste wyjaśnienie

Temperatura kontroluje poziom losowości używany przez model przy wyborze tokenów. Niższa temperatura zwykle daje bardziej przewidywalne i spójne wyniki. Wyższa może zwiększać różnorodność i kreatywność, ale także ryzyko odejścia od instrukcji. To nie jest pokrętło jakości, lecz pokrętło wariantowości.

Przykład: Do wyodrębniania danych z faktur użyj niskiej temperatury. Do wygenerowania dziesięciu nazw marki użyj wyższej temperatury, a potem przefiltruj wyniki.

Jak model wybiera każde słowo: greedy, top-k i top-p

Temperatura jest jednym z ustawień większego etapu nazywanego dekodowaniem (lub próbkowaniem). Na każdej pozycji model przypisuje prawdopodobieństwo każdemu możliwemu kolejnemu tokenowi, a metoda dekodowania decyduje, który kandydat zostanie faktycznie wybrany. Te ustawienia wyjaśniają, dlaczego ten sam prompt może dawać sztywne, lekko powtarzalne albo bardzo kreatywne wyniki zależnie od konfiguracji API.

Najczęstsze metody, od najbardziej rygorystycznych do najbardziej elastycznych:

Greedy

Wybiera token o najwyższym prawdopodobieństwie na każdym kroku. Usuwa to losowość próbkowania dla tego dekodera, ale identyczny wynik nie jest gwarantowany między wersjami modelu, implementacjami numerycznymi, zmianami backendu ani niedeterministyczną infrastrukturą.

Top-k

Zachowuje tylko k najbardziej prawdopodobnych tokenów, na przykład 40, a następnie wybiera spośród nich. Lista kandydatów ma stały rozmiar niezależnie od pewności modelu.

Top-p (nucleus)

Zachowuje najmniejszy zestaw tokenów, których łączne prawdopodobieństwa osiągają p, na przykład 0,9. Lista kandydatów kurczy się, gdy model jest pewny, i rośnie, gdy jest niepewny.

Min-p

Nowsza opcja: zachowuje tokeny, które osiągają co najmniej określoną część prawdopodobieństwa najlepszego tokenu. Przy wysokiej temperaturze zwykle pozostaje stabilniejsza niż top-p.

Te ustawienia wzajemnie na siebie wpływają, ale dokładna kolejność i dostępne parametry zależą od implementacji. W typowym pipeline temperatura przeskalowuje logity przed filtrem top-k lub top-p; inne środowiska wykonawcze mogą łączyć lub porządkować procesory inaczej. Niektórzy dostawcy zalecają zmieniać temperaturę albo top-p zamiast obu naraz, ale należy stosować się do dokumentacji konkretnego modelu i API.

Przykład: Do wyodrębniania JSON lub argumentów narzędzi preferuj wyjście strukturalne ograniczone schematem albo wywoływanie funkcji/narzędzi, jeśli dostawca to obsługuje. Niska temperatura może być dodatkowym ustawieniem stabilności, ale nie zastępuje walidacji. Przy burzy mózgów ustawienie próbkowania wspierane przez dostawcę może zwiększyć różnorodność. Temperatura 0 oznacza „tak deterministycznie, jak pozwala implementacja”, a nie twardą gwarancję.
Porównanie strategii dekodowania greedy, top-k i top-p przy wyborze kolejnego tokenu.
Dekodowanie greedy oraz próbkowanie top-k i top-p zachowują różne zbiory kandydatów przed wyborem kolejnego słowa.

Następnie zobacz praktyczne przykłady promptów

Użyj uniwersalnego generatora promptów, aby przełożyć te pojęcia AI na praktyczne prompty do pisania, wyszukiwania informacji, pracy, nauki i codziennych zadań.

Udostępnij ten poradnik

Dodaj PromptingEasy do ekranu

Otwórz menu przeglądarki i wybierz opcję instalacji tej witryny lub dodania jej do ekranu początkowego.