RAG智能体构建-88
完结未商业化2026.07 - 2026.07
Ragworkflow
项目背景
针对亚马逊合规政策极度繁杂、人工排查耗时长且易漏判的痛点,从 0 到 1 规划并落地企业级风控智能体。系统覆盖 IP 侵权、Listing 合规、产品合规、真实性防伪、受限内容等五大风控维度,实现对商品上架前合规风险的全链路自动化筛查与报告生成。
核心职责与专业实践:
1、基于业务目标的智能体架构设计 (Agent Architecture)
- 动态路由与模块化知识库: 深度解构五大合规模块,在意图识别节点建立动态路由机制(Router)。根据商品触发的具体风险类型,精准分发至对应的专项知识库(如 IP 侵权、Listing 违规),有效规避全局检索带来的上下文交叉干扰。
- 业务逻辑映射与双路检索: 将单点风险评估解耦为“违规事实界定”与“违规后果预判”双路定向检索,在提高召回率的同时,确保最终分析严格贴合平台规定与真实处罚基准。
- 高扩展性底座设计: 采用松耦合工作流架构。在 MVP 阶段优先跑通 IP 侵权与 Listing 违规评估,未来仅需增配特定领域文档与路由分支,即可无缝横向扩展为全域风控系统。
2、精细化数据工程与结构化感知切片 (Data Engineering & Chunking)
- 上下文固化与去噪: 在数据清洗阶段,去除干扰信息,保留md文档格式,并通过脚本强制将“面包屑导航”与“层级结构”注入每个切片(Chunk)的头部,彻底解决切片在向量空间中逻辑断层、上下文丢失的行业痛点。
- 分段策略与元数据矩阵: 结合政策文档特性,摒弃易导致语义截断的纯字数切分,采用“按段落+字符重叠(Overlap)”的最佳实践;构建多维业务元数据(Metadata)标签体系,在检索底层实现物理级的预过滤(Pre-filtering)。
3、查询重构、降噪召回与反幻觉控制 (Query Expansion & Anti-Hallucination)
- (1)消解口语化偏差与对抗高频词泛化:
- 引入查询扩写机制,将口语化提问转化为精准检索词。
- 针对大模型扩写极易产生泛化词(如亚马逊、政策)导致检索失焦的痛点,引入负面提示词(Negative Prompt)黑名单策略,强制提取高优特异词;
- 同时在检索端采用混合检索(Hybrid Search)策略,大幅提升核心条款召回准确率。
- (2)防幻觉与强制溯源:
- 设定严格的大模型 System Prompt 依据围栏,要求智能体必须基于召回事实进行研判,并强制引用具体政策文件与条款出处,从根本上杜绝 AI 知识臆测。
4、搭建全链路 LLMOps 评测闭环 (Evaluation Framework)
(1)全链路追踪与归因调试:
- 构建【检索评估集】,通过“用户问题 -> 扩写关键词 -> 召回切片”的链路追踪,针对性倒逼查询节点的逻辑优化,以保障检索召回准确率。
- 通过【检索评估集】与【风险分析报告评估集】联动测评,实现控制变量法的归因调试,以保障风险分析报告的效果。
- (2)评估基准量化:
- 确立涵盖可验证性、风险覆盖完整性、决策明确性、可执行性、不确定性处理、用户可读性的 6 大维度的风控报告评估标准,为后续引入 LLM-as-a-judge(大模型自动裁判)流水线奠定标准化数据基础。
项目成果与业务价值:
- 交付闭环与降本增效: 仅用时 1 个月成功跑通核心风控业务的 MVP 闭环,验证了合规业务自动化流转的可行性;预计全线模块上线后,单次全盘风险审查时效将从人工的 4 小时大幅压缩至 5 分钟。
- 沉淀企业级资产: 沉淀出一套从 0 到 1 跑通并沉淀企业级 RAG 应用建设 SOP。将数据预处理、多路召回策略、智能体工作流编排、评测调优闭环等核心逻辑标准化,大幅降低试错成本,为团队后续快速孵化同类 AI 产品提供底层基建支撑与标准范式。
- 下一阶段规划 (Roadmap): 计划补全剩余三大风险模块;引入真实卖家申诉案例与处罚判例库,增强最终风控报告的实战指导价值与“拟人化”服务体验。
系统结构图

视频介绍
沉淀的知识与方法
关联问题(项目实现过程中沉淀的方法论)
如何构建自己的RAG知识库智能体?
2026-08-25
