<!-- Canonical URL: https://ask.atlascloud.ai/pl/build-sanitized-request-replay-set-llm-api-migration -->

# Jak zbudować oczyszczony zestaw odtwarzania żądań do migracji API LLM?

> Zbuduj minimalny, wersjonowany korpus, dobierając przykłady według pokrycia, usuwając zbędne pola, konsekwentnie zastępując wartości wrażliwe syntetycznymi danymi zachowującymi strukturę, izolując narzędzia i ponownie skanując wynik.

Wybierz reprezentatywne żądania, wykryj i zastąp sekrety oraz dane osobowe, zachowaj strukturę wpływającą na zachowanie modelu i sprawdź, że nic wrażliwego nie zostało. Zapisz wynik jako wersjonowany artefakt testowy z asercjami, nie eksport surowych logów.

Celem jest pokrycie zachowania bez kopiowania ryzyka produkcyjnego.

## Określ, co ma udowodnić odtwarzanie

Przed próbkowaniem wypisz ryzyka: długość, języki, schema narzędzi, wynik strukturalny, części multimodalne, streaming, odmowy bezpieczeństwa, duży kontekst i parametry.

Utwórz kategorie pokrycia i wybieraj świadomie. Losowa próbka może pominąć rzadkie formy, a zestaw samych błędów zniekształca normalny ruch.

## Minimalizuj podczas zbierania

Eksportuj tylko potrzebne pola. Usuń nagłówki autoryzacji, cookies, IP, metadane konta, rozliczenia i niepowiązane logi przed środowiskiem testowym.

Użyj listy dozwolonej, np.:

```json
{
  "fixture_id": "fx_0042",
  "request": {
    "model_alias": "support_default",
    "messages": [],
    "tools": [],
    "temperature": 0.2
  },
  "assertions": {
    "valid_json": true,
    "required_keys": ["category", "confidence"]
  }
}
```

Twórz nowy `fixture_id` i nie używaj ID użytkownika ani dostawcy jako publicznego klucza.

## Wykrywaj dane wrażliwe warstwowo

Łącz skanery deterministyczne, słowniki organizacji i przegląd kontekstu. Szukaj kluczy API, tokenów, kluczy prywatnych, połączeń, e-maili, telefonów, kont, hostów wewnętrznych, sekretów kodu i regulowanych ID.

Żaden skaner nie jest pełny. Uruchamiaj kilka przejść i kieruj niepewne trafienia do uprawnionego recenzenta. Metadane i piksele obrazów i dokumentów także mogą być wrażliwe.

## Zastępuj z zachowaniem zachowania

Używaj spójnych typowanych znaczników jak `<EMAIL_1>` i `<ORDER_ID_2>`. Ta sama wartość w przypadku powinna mieć ten sam znacznik, lecz mapowanie nie może być odwracalne poza kontrolowanym procesem.

Zachowaj przybliżoną długość, klasę Unicode, typ JSON, wielkość list, separatory i relacje. Jeśli błąd zależy od tokenów, użyj bezpiecznego tekstu syntetycznego o podobnej długości.

Nie ograniczaj się do hashowania telefonów i wartości o małej entropii. Usuwaj lub syntetyzuj, jeśli nie potrzeba odwracalności.

## Usuń treści aktywne i niebezpieczne

Przypadki mogą zawierać prompt injection, polecenia, URL lub kod z efektami. Domyślnie wyłącz narzędzia zewnętrzne i zastąp zapisujące narzędzia atrapami deterministycznymi.

Zezwalaj na sieć tylko do kontrolowanych endpointów testowych. Nie odtwarzaj danych produkcyjnych, podpisanych URL, niszczących poleceń ani webhooków klientów.

## Dodaj asercje zamiast dokładnych odpowiedzi

Wynik LLM może się zmieniać. Zapisuj sprawdzenia schema, pól wymaganych, wyboru narzędzia, odmowy, języka, maksymalnego opóźnienia, limitów tokenów i oceny semantycznej. Dokładne porównanie stosuj tylko do zadań deterministycznych.

W każdej sesji zapisuj modele źródłowy i docelowy, wersję adaptera, szablon i datę.

## Zweryfikuj oczyszczony artefakt

Przed zatwierdzeniem skanuj sekrety i PII, sprawdzaj typy plików i ręcznie przeglądaj próbkę. Potwierdź, że każda kategoria pozostała. Bezpieczny przypadek, który nie odtwarza zachowania, zastąp syntetycznym odpowiednikiem.

Chroń zestaw jak dane testowe, nie publiczną dokumentację. Stosuj dostęp, retencję, audyt i usuwanie. Tymczasowe mapowanie trzymaj osobno i zniszcz po walidacji, jeśli polityka pozwala.

## Użyj jako bramy migracji

Uruchamiaj te same przypadki przez adapter źródłowy i docelowy. Porównuj znormalizowane wyniki, błędy, opóźnienie, użycie i koszt. Badaj różnice według kategorii i dodawaj przypadki regresji.

Wersjonuj zestaw i zasady oczyszczania razem.

## Podsumowanie

Bezpieczny zestaw odtwarzania to zaprojektowany minimalny korpus testowy, nie kopia logów. Stosuj wykrywanie warstwowe, syntetyczne dane zachowujące strukturę, izolację efektów i asercje zachowania. Ponownie przeskanuj artefakt przed użyciem go jako bramy migracji.

## FAQ

### Dlaczego nie odtwarzać losowego eksportu logów produkcyjnych?

Surowe logi mogą ujawniać sekrety i dane osobowe, a losowa próbka może pominąć rzadkie formy. Zbuduj minimalny zestaw według jawnych kategorii ryzyka.

### Jak zastępować wartości wrażliwe?

Używaj spójnych typowanych znaczników lub danych syntetycznych, które zachowują długość, typ, separatory, klasę Unicode i ważne relacje bez odwracalności.

### Czy hashowanie wystarcza do anonimizacji danych użytkownika?

Nie dla wartości o małej entropii, takich jak telefony, które można odgadnąć. Usuwaj lub syntetyzuj, gdy odwracalność nie jest potrzebna.

### Jak bezpiecznie odtwarzać wywołania narzędzi?

Domyślnie wyłącz narzędzia zewnętrzne i zastąp je deterministycznymi atrapami. Nie używaj danych produkcyjnych, webhooków klientów ani realnych zapisów.

### Czy oczekiwany wynik musi być identyczny?

Zwykle nie. Używaj asercji schema, pól, wyboru narzędzia, odmowy, języka, opóźnienia, użycia i oceny; dokładność zostaw zadaniom deterministycznym.

### Jak zatwierdzić końcowy zestaw?

Skanuj sekrety i PII, sprawdź pliki, ręcznie przejrzyj próbkę, potwierdź pokrycie i zastosuj kontrolę dostępu, retencję i usuwanie.
