Chapters
章节目录
AI Harness 不是测试脚本,而是 AI 系统的质量控制台
理解 AI Harness Engineering 的核心定义与边界。通过对比传统测试、LLOps 与 AI Harness,学习如何结合 OpenAI 评测最佳实践、OpenTelemetry 观测标准和 NIST AI RMF 风险管理框架,设计出高复用、可量化的 AI 系统质量控制台。
先写任务协议,再谈评测指标
本单元将引导你跳出盲目追求评测分数的误区,手把手教你将一个 AI 功能拆解为输入、上下文、输出契约、拒答边界、成功标准和黄金测试集,为整个 AI 测试夹具(Harness)奠定坚实的数据协议基础。
Golden Dataset:把“感觉不错”变成可回归样例
本指南介绍如何为企业知识库问答与工具调用场景设计 Golden Dataset(黄金数据集)。涵盖 schema 设计、边界样例采集、MCP(Model Context Protocol)上下文边界处理、标注规则以及版本控制策略,助你摆脱“感觉不错”的模糊评估,构建量化可复现的回归测试集。
评测不是一个分数:判分器、断言和人工复核怎么组合
本单元深入探讨 AI 评测指标的多层组合策略,比较规则断言、LLM judge、人工复核、pairwise 对比和业务指标的边界,并输出一套评测指标矩阵、LLM judge rubric 和人工复核抽样策略。
结构化输出 Harness:先挡住形状错误,再处理业务错误
本指南介绍如何通过构建双层防御 Harness(Zod物理形状校验与业务语义校验)来拦截 AI 失控输出,设计自动重试与隔离队列(Quarantine Queue),并结合 OpenTelemetry 观测模型退化。
Tool Harness:模型只能提议动作,执行权必须被隔离
设计工具 schema、风险分级、执行沙箱、幂等控制、审计日志、人工确认拦截器以及基于 MCP 信任边界的受控执行架构,将“Agent 自动办事”转换为“应用层受控执行”。
RAG Harness:先评检索,再评回答
深入探讨 RAG 应用的评估体系设计。本单元抛弃“单一相似度评估”的幻想,带领你构建“先评检索、再评回答”的双阶段评估 Harness,涵盖检索命中、上下文覆盖、引用一致性、主动拒答及基于 Trace 数据的知识刷新策略。
Agent Harness:把多步智能体变成可暂停、可恢复、可审计的状态机
本指南介绍如何为多步 Agent 设计状态机 Harness,实现执行预算控制、步骤级 Trace 记录、人审节点拦截以及基于状态快照的失败恢复与回放调试。
红队与安全 Harness:把提示注入当成常规回归项
本单元介绍如何将提示注入、敏感信息泄露、过度代理和输出处理等生成式 AI 安全风险转化为自动化 Harness 的回归测试用例。通过引入红队工具链与自动化阻断策略,确保 AI 应用在迭代中不发生安全退化。
观测 Harness:trace 里该看见什么,不该记录什么
本指南介绍如何为大模型应用(特别是涉及 Agent、RAG 和工具调用的系统)设计符合隐私安全合规、高排查效率的观测 Harness。课程将详细拆解 GenAI 专属 Trace 字段清单、数据脱敏策略(PII/提示词保护)以及基于 Trace 的异常排查路径,确保系统线上运行状态可被精确量化,同时规避合规与合规安全风险。
CI 回归门禁:让 Prompt、模型和检索改动都要过关
介绍如何为 AI 应用(Prompt、检索、模型等变更)设计并实现基于 GitHub Actions 的 CI 回归门禁,集成 Schema 校验、安全样例、RAG 评测与阈值阻断策略。
线上反馈回流:用户反馈怎样变成下一版样例
本指南介绍如何将线上用户的真实反馈(包含赞同、反对、纠错等行为)结构化为 feedback taxonomy,经过过滤、脱敏、复盘和样例晋级机制,最终通过 LangSmith 和 DVC 转化为下一代 AI 应用的黄金评测数据集,实现评测样例的高效回流与版本控制。
模型路由与发布 Harness:灰度、回滚和成本风险一起看
为 AI 应用设计模型、Prompt、RAG 检索及工具版本的联合路由机制,结合灰度发布、影子测试、动态成本监控与回滚 Checklist,构建高可靠的 AI 持续发布 Harness。
综合项目:交付一个 AI Harness Engineering 蓝图
本综合项目要求学习者为企业级多步骤 AI 理财 Agent 系统设计并交付一套完整的 AI Harness Engineering 蓝图,整合任务协议、数据集管理、Eval 评测、Tool 拦截、RAG 度量、Agent 追踪、安全围栏、CI 门禁及生产反馈闭环。