<!-- Canonical URL: https://ask.atlascloud.ai/zh/build-sanitized-request-replay-set-llm-api-migration -->

# 如何为 LLM API 迁移构建经过脱敏的请求回放集？

> 围绕行为覆盖选择样本、删除不必要字段、用一致且保留结构的合成数据替换敏感值、隔离外部工具，并在批准前重新扫描最终制品，从而建立最小化且带版本的回放语料。

构建脱敏回放集时，应从生产请求中选择有代表性的样本，识别并替换密钥与个人数据，同时保留影响模型行为的结构特征，最后确认没有敏感内容残留。将它保存为带版本的测试制品和断言，而不是原始日志导出。

目标是在不把生产风险复制到新数据集的情况下覆盖真实行为。

## 定义回放要证明什么

采样前列出迁移风险，包括提示词长度、语言、工具 schema、结构化输出、多模态部分、流式传输、安全拒答、大上下文和模型参数。

建立覆盖类别并有目的地选择样本。随机样本可能遗漏罕见但重要的形态，只收集历史故障又会扭曲正常流量。

## 在收集阶段最小化数据

只导出回放必需字段。在数据进入测试空间前删除授权头、Cookie、IP 地址、账户元数据、账单字段和无关日志。

可使用如下允许列表：

```json
{
  "fixture_id": "fx_0042",
  "request": {
    "model_alias": "support_default",
    "messages": [],
    "tools": [],
    "temperature": 0.2
  },
  "assertions": {
    "valid_json": true,
    "required_keys": ["category", "confidence"]
  }
}
```

生成新的 `fixture_id`，不要把用户 ID 或服务商请求 ID 当作公开测试样本键。

## 分层检测敏感数据

结合确定性检测器、组织专用词典和上下文审查。查找 API 密钥、Bearer token、私钥、连接字符串、邮箱、电话、账户号、内部主机名、源码密钥和受监管标识符。

任何检测器都不完整。应运行多轮检查，并让授权审查者处理不确定匹配。图像和附件也属于数据源，其元数据和像素都可能含有敏感信息。

## 替换时保留行为

使用 `<EMAIL_1>` 或 `<ORDER_ID_2>` 这类带类型的一致占位符。同一测试样本中的同一原值应映射为相同占位符，但在受控临时流程之外不能反向恢复。

保留与测试有关的特性，例如大致长度、Unicode 类别、JSON 类型、列表大小、分隔符形态和字段关系。若令牌长度会触发问题，就用令牌数接近的安全合成文本替代。

不要只对手机号等低熵值做哈希，它们通常可以被猜出。不需要可逆性时，应删除或合成。

## 移除主动和危险内容

回放集可能包含提示词注入、工具命令、URL 或会产生副作用的代码。默认禁用外部工具，并用确定性桩替换可写工具。

网络访问只能指向受控测试端点。不得回放生产凭证、签名 URL、破坏性命令或客户 webhook 地址。

## 添加断言，而不是精确答案

LLM 输出会变化，因此应保存行为检查，包括 schema 有效性、必填字段、工具选择、拒答类别、语言、最大延迟、令牌边界和语义评分。只有真正确定性的转换才适合精确匹配。

每次运行都记录源和目标模型 ID、适配器版本、提示模板版本与回放日期。

## 验证脱敏制品

批准前运行密钥扫描、PII 检测、文件类型检查和人工抽样。确认脱敏后每个覆盖类别仍然存在。若测试样本安全但不再触发原行为，就应以合成等价样本替换。

把回放集当作测试数据而非公开文档来保护，应用访问控制、保留期、审计日志和删除路径。临时原值映射应分开存放，并在策略允许时于验证后销毁。

## 用作迁移门禁

通过源适配器和目标适配器运行相同样本，比较统一后的输出、错误行为、延迟、用量和成本。按覆盖类别调查差异，并为新发现的不兼容增加回归样本。

数据集和脱敏规则应一同版本化，保证结果可解释。

## 总结

安全回放集是专门设计、最小化的测试语料，而不是复制的生产日志。应分层检测和审查，用保留结构的合成数据替换敏感值，隔离副作用，并附加行为断言。在它成为迁移门禁前，再对最终制品执行一次扫描。

## FAQ

### 为什么不能直接回放随机生产日志？

原始日志可能暴露密钥和个人数据，随机抽样也可能遗漏罕见请求形态。应围绕明确的迁移风险类别构建最小集合。

### 应如何替换敏感值？

使用带类型的一致占位符或合成数据，保留相关长度、类型、分隔符、Unicode 类别和字段关系，同时避免可逆。

### 哈希足以匿名化用户数据吗？

对手机号等低熵值通常不够，因为它们可以被猜出。不需要恢复时，优先删除或使用合成数据。

### 如何安全回放工具调用请求？

默认禁用外部工具，并用确定性桩替代。不得包含生产凭证、客户 webhook 或有写入副作用的操作。

### 预期输出应使用精确文本吗？

通常不应。可使用 schema、必填字段、工具选择、拒答、语言、延迟、用量和评分断言，精确匹配只适用于确定性任务。

### 如何批准最终回放集？

运行密钥与 PII 扫描，检查嵌入文件，人工抽查，确认覆盖仍完整，并设置访问控制、保留期和删除策略。
