<!-- Canonical URL: https://ask.atlascloud.ai/it/build-sanitized-request-replay-set-llm-api-migration -->

# Come si crea un set sanitizzato di replay delle richieste per migrare un'API LLM?

> Crea un corpus minimo e versionato campionando per copertura, rimuovendo campi inutili, sostituendo i valori sensibili con dati sintetici coerenti che preservano la struttura, isolando gli strumenti esterni e analizzando di nuovo l'artefatto finale.

Seleziona richieste rappresentative, rileva e sostituisci segreti e dati personali, preserva la struttura che influisce sul modello e verifica che non rimanga contenuto sensibile. Salva il risultato come artefatto di test versionato con asserzioni, non come esportazione di log grezzi.

L'obiettivo è coprire il comportamento senza copiare il rischio di produzione.

## Definisci cosa deve dimostrare il replay

Elenca i rischi prima del campionamento: lunghezza, lingue, schema degli strumenti, output strutturato, parti multimodali, streaming, rifiuti di sicurezza, contesto ampio e parametri.

Crea categorie di copertura e scegli i casi deliberatamente. Un campione casuale può perdere forme rare; una raccolta di soli fallimenti distorce il traffico normale.

## Riduci i dati durante la raccolta

Esporta soltanto i campi necessari. Rimuovi header di autorizzazione, cookie, IP, metadati account, fatturazione e log estranei prima dell'ingresso nello spazio di test.

Usa una lista consentita come questa:

```json
{
  "fixture_id": "fx_0042",
  "request": {
    "model_alias": "support_default",
    "messages": [],
    "tools": [],
    "temperature": 0.2
  },
  "assertions": {
    "valid_json": true,
    "required_keys": ["category", "confidence"]
  }
}
```

Genera un nuovo `fixture_id` e non usare ID utente o provider come chiave pubblica del caso.

## Rileva i dati sensibili a strati

Combina scanner deterministici, dizionari aziendali e revisione contestuale. Cerca chiavi API, token, chiavi private, stringhe di connessione, email, telefoni, conti, host interni, segreti nel codice e identificatori regolamentati.

Nessuno scanner è completo. Esegui più passaggi e invia le corrispondenze incerte a un revisore autorizzato. Anche metadati e pixel di immagini e documenti possono contenere informazioni sensibili.

## Sostituisci preservando il comportamento

Usa segnaposto tipizzati coerenti come `<EMAIL_1>` e `<ORDER_ID_2>`. Lo stesso valore deve ricevere lo stesso segnaposto nel caso, ma la mappatura non deve essere reversibile fuori da un processo temporaneo controllato.

Preserva lunghezza approssimativa, classe Unicode, tipo JSON, dimensione delle liste, delimitatori e relazioni. Se il problema dipende dai token, usa testo sintetico sicuro di dimensione simile.

Non limitarti a fare hash di telefoni o valori a bassa entropia. Elimina o sintetizza se non serve reversibilità.

## Rimuovi contenuto attivo e pericoloso

I casi possono contenere prompt injection, comandi, URL o codice con effetti. Disattiva gli strumenti esterni e sostituisci quelli di scrittura con stub deterministici.

Consenti rete solo verso endpoint di test controllati. Non riprodurre credenziali di produzione, URL firmati, comandi distruttivi o webhook clienti.

## Aggiungi asserzioni, non risposte esatte

L'output LLM può variare. Salva controlli di schema, campi obbligatori, scelta dello strumento, categoria di rifiuto, lingua, latenza massima, limiti token e valutazione semantica. Usa il confronto esatto solo per trasformazioni deterministiche.

Registra modelli di origine e destinazione, versione dell'adattatore, template e data per ogni esecuzione.

## Valida l'artefatto sanitizzato

Prima dell'approvazione esegui scansioni di segreti e PII, ispezione dei tipi file e revisione manuale di un campione. Conferma che ogni categoria resti presente. Sostituisci un caso sicuro ma non più efficace con un equivalente sintetico.

Proteggi il set come dati di test, non documentazione pubblica. Applica accesso, conservazione, audit ed eliminazione. Separa la mappa temporanea e distruggila dopo la validazione se consentito.

## Usalo come gate di migrazione

Esegui gli stessi casi con gli adattatori di origine e destinazione. Confronta output normalizzati, errori, latenza, uso e costo. Esamina le differenze per categoria e aggiungi regressioni per nuove incompatibilità.

Versiona insieme set e regole di sanitizzazione.

## In sintesi

Un replay set sicuro è un corpus di test minimo e progettato, non una copia dei log. Applica rilevamento a strati, dati sintetici che preservano la struttura, isolamento degli effetti e asserzioni di comportamento. Scansiona di nuovo l'artefatto prima di usarlo come gate.

## FAQ

### Perché non riprodurre un'esportazione casuale dei log di produzione?

I log grezzi possono esporre segreti e dati personali, mentre un campione casuale può perdere forme rare. Costruisci un set minimo in base a categorie di rischio esplicite.

### Come vanno sostituiti i valori sensibili?

Usa segnaposto tipizzati coerenti o dati sintetici che preservino lunghezza, tipo, delimitatori, classe Unicode e relazioni utili senza essere reversibili.

### L'hashing basta per anonimizzare i dati utente?

Non per valori a bassa entropia come i numeri di telefono, che possono essere indovinati. Preferisci eliminazione o sintesi quando non serve reversibilità.

### Come si riproducono in sicurezza le chiamate agli strumenti?

Disattiva per impostazione predefinita gli strumenti esterni e sostituiscili con stub deterministici. Non includere credenziali, webhook clienti o effetti di scrittura reali.

### Gli output attesi devono corrispondere esattamente?

Di solito no. Usa asserzioni per schema, campi, scelta dello strumento, rifiuto, lingua, latenza, uso e rubriche; limita l'uguaglianza esatta alle attività deterministiche.

### Come si approva il set finale?

Esegui scansioni di segreti e PII, ispeziona i file, rivedi manualmente un campione, conferma la copertura e applica accesso, conservazione ed eliminazione.
