<!-- Canonical URL: https://ask.atlascloud.ai/pt/build-sanitized-request-replay-set-llm-api-migration -->

# Como criar um conjunto sanitizado de replay de solicitações para uma migração de API de LLM?

> Crie um corpus mínimo e versionado selecionando por cobertura, removendo campos desnecessários, substituindo dados sensíveis por valores sintéticos consistentes que preservem a estrutura, isolando ferramentas e examinando o artefato final.

Crie um conjunto sanitizado selecionando solicitações representativas, detectando e substituindo segredos e dados pessoais, preservando propriedades estruturais que afetam o modelo e verificando que não reste conteúdo sensível. Salve-o como artefato de teste versionado com asserções, não como exportação de logs brutos.

O objetivo é cobrir o comportamento sem copiar o risco de produção para outro conjunto de dados.

## Defina o que o replay deve provar

Liste os riscos antes de selecionar amostras. Dimensões comuns incluem comprimento, idiomas, schemas de ferramentas, saída estruturada, partes multimodais, streaming, recusas de segurança, contexto grande e parâmetros.

Crie categorias de cobertura e escolha casos deliberadamente. Uma amostra aleatória pode ignorar formatos raros, enquanto uma coleção somente de falhas pode distorcer o tráfego normal.

## Minimize durante a coleta

Exporte apenas os campos necessários. Remova cabeçalhos de autorização, cookies, endereços IP, metadados de conta, cobrança e logs não relacionados antes de os dados chegarem ao espaço de teste.

Use uma lista de permissões como esta:

```json
{
  "fixture_id": "fx_0042",
  "request": {
    "model_alias": "support_default",
    "messages": [],
    "tools": [],
    "temperature": 0.2
  },
  "assertions": {
    "valid_json": true,
    "required_keys": ["category", "confidence"]
  }
}
```

Gere um `fixture_id` novo. Não reutilize ID de usuário ou de provedor como chave pública do caso.

## Detecte dados sensíveis em camadas

Combine detectores determinísticos, dicionários da organização e revisão contextual. Procure chaves de API, tokens, chaves privadas, strings de conexão, emails, telefones, contas, hosts internos, segredos em código e identificadores regulados.

Nenhum detector é completo. Execute várias passagens e envie correspondências incertas a uma pessoa autorizada. Imagens e documentos também são fontes de dados; metadados e pixels podem conter informações sensíveis.

## Substitua preservando o comportamento

Use marcadores tipados e consistentes, como `<EMAIL_1>` e `<ORDER_ID_2>`. O mesmo valor deve receber o mesmo marcador dentro de um caso, mas o mapeamento não deve ser reversível fora de um processo temporário controlado.

Preserve propriedades relevantes: comprimento aproximado, classe Unicode, tipo JSON, tamanho de listas, delimitadores e relações entre campos. Se uma falha depende do tamanho em tokens, substitua o texto por conteúdo sintético seguro de tamanho semelhante.

Não aplique apenas hash a telefones ou outros valores de baixa entropia. Eles podem ser adivinhados. Exclua ou sintetize quando não precisar de reversibilidade.

## Remova conteúdo ativo e perigoso

Os casos podem conter injeção de prompt, comandos, URLs ou código com efeitos colaterais. Desative ferramentas externas por padrão e substitua ferramentas de escrita por stubs determinísticos.

Permita rede apenas para endpoints de teste controlados. Nunca repita credenciais de produção, URLs assinadas, comandos destrutivos ou webhooks de clientes.

## Adicione asserções, não respostas exatas

A saída de um LLM pode variar. Armazene verificações de schema, campos obrigatórios, seleção de ferramenta, categoria de recusa, idioma, latência máxima, limites de tokens e rubricas semânticas. Use correspondência exata somente em transformações determinísticas.

Registre modelos de origem e destino, versão do adaptador, versão do template e data em cada execução.

## Valide o artefato sanitizado

Antes da aprovação, execute scanners de segredos e PII, inspeção de tipos de arquivo e revisão manual de uma amostra. Confirme que todas as categorias permanecem representadas. Se um caso estiver seguro, mas já não reproduzir o comportamento, troque-o por um equivalente sintético.

Proteja o conjunto como dados de teste, não como documentação pública. Aplique acesso, retenção, auditoria e exclusão. Separe qualquer mapa temporário de substituições e destrua-o após a validação quando a política permitir.

## Use-o como porta de migração

Execute os mesmos casos nos adaptadores de origem e destino. Compare saídas normalizadas, erros, latência, uso e custo. Investigue por categoria e acrescente regressões para incompatibilidades novas.

Versione o conjunto e as regras de sanitização juntos para manter os resultados explicáveis.

## Em resumo

Um conjunto seguro é um corpus de teste mínimo e planejado, não logs copiados. Aplique detecção e revisão em camadas, troque valores sensíveis por dados sintéticos que preservem a estrutura, neutralize efeitos e acrescente asserções de comportamento. Examine novamente o artefato antes de usá-lo como porta de migração.

## FAQ

### Por que não repetir uma exportação aleatória de logs de produção?

Logs brutos podem expor segredos e dados pessoais, e uma amostra aleatória pode ignorar formatos raros. Monte um conjunto mínimo por categorias explícitas de risco.

### Como substituir valores sensíveis?

Use marcadores tipados consistentes ou dados sintéticos que preservem comprimento, tipo, delimitadores, classe Unicode e relações relevantes sem serem reversíveis.

### Um hash basta para anonimizar dados de usuário?

Não para valores de baixa entropia, como telefones, que podem ser adivinhados. Prefira excluir ou sintetizar quando a reversibilidade não for necessária.

### Como repetir chamadas de ferramentas com segurança?

Desative ferramentas externas por padrão e troque-as por stubs determinísticos. Nunca inclua credenciais, webhooks de clientes ou efeitos de escrita em produção.

### As saídas esperadas devem ser texto exato?

Em geral, não. Use asserções de schema, campos, ferramenta, recusa, idioma, latência, uso e rubrica; reserve igualdade exata para tarefas determinísticas.

### Como aprovar o conjunto final?

Execute scanners de segredos e PII, inspecione arquivos, revise uma amostra, confirme a cobertura e aplique controles de acesso, retenção e exclusão.
