芯禾 XinheBot · 智能中台系统架构
Vue3 双端 · Django / SpringBoot 双后端 · LangGraph 3 子 Agent · vLLM 推理 · A2A 分布式集群
① 前端层 Frontend · Vue3 + Vite
PC 管理后台
完整管理端
- 知识库管理 / 文档批量入库
- RAG 检索调试 · Agent 任务监控
- 多租户 RBAC 权限配置 · 报告预览
移动端 H5(Vant4)
轻量化现场作业端
- 拍照上传 · 接收任务 · 查看 AI 结果
- IndexedDB 离线缓存 · 请求队列
- 弱网断点续传 · 网络恢复自动同步
▼ HTTPS / REST ▼
② 业务接入层 Backend · 双技术栈
方案 A · Django(原型)
快速迭代 / AI 原型验证
- 业务 CRUD · RBAC 权限 · 任务管理
- 快速迭代 Prompt 与文档解析流程
方案 B · SpringBoot(生产)
面向高并发业务接入
- API 网关限流 · 分布式锁 · 连接池
- 多租户隔离 · 企业级事务 · 异步任务调度
▼ HTTP / gRPC 调用 AI 中台 ▼
③ AI 中台层 AI Service · FastAPI + LangGraph
RAG · 多 Agent · 工具调用 · 模型路由降级 · RAGAS 评测
① 业务规划 Agent
任务拆解 · CoT 推理 · 会话状态管理 · 模型路由 · 断点续跑
② 文档 & 研判 Agent
RAG 向量检索 · OCR 多模态解析 · VLM 图像识别 · RAGAS 评测
③ 报告生成 Agent
多 Agent 结果汇总 · 结构化报告 · 原文引用溯源 · PDF 导出
▼ OpenAI 兼容 API · 统一推理网关 ▼
④ 模型推理层 Inference · vLLM高并发核心
Qwen / DeepSeek LLM · VLM 多模态模型 · 本地私有化部署
vLLM 推理加速
PagedAttention 分页 KV Cache · 连续批处理 Continuous Batching · 张量并行 Tensor Parallel · 增量解码,单卡吞吐提升 5-10x
高并发处理方案
请求级批处理聚合 · KV Cache 前缀复用(RAG 系统 Prompt 共享)· 多模型实例水平扩展 · 负载均衡调度 · 超时与流式 SSE 回传
降级与治理
多模型路由(Qwen → DeepSeek 自动切换)· 队列排队限流 · GPU 显存水位监控 · 失败重试 · 推理耗时 / Token 指标监控
A2A · Agent-to-Agent 协议分布式集群
⑤ 边缘机器人集群 Edge Fleet · 多地分布式部署
远端机器人 Agent 节点
现场感知 + 执行(不做 heavy LLM 推理)
- 巡检机器人 / 无人机 · 本地图像采集
- 弱网本地缓存 · 异常事件上报中心
- 接收中心下发任务指令 · 执行状态回传
A2A 协议职责
中心 ↔ 远端 解耦通信
- 能力声明 / 任务协商 / 消息格式约定
- 跨节点状态同步 · 故障重连与幂等
- 业务后端不直连机器人,统一走 AI 中台
▼ 读写 ▼
架构要点:
Java / Django 业务层只负责用户、权限、高并发接入,不写 LLM 推理与 Agent 编排;
RAG、3 子 Agent 集中在 Python FastAPI 中台,通过 OpenAI 兼容协议调用 vLLM 推理服务。
高并发由 vLLM 的 PagedAttention + 连续批处理 + KV Cache 前缀复用承担,配合多实例水平扩展与限流降级。
远端机器人集群通过 A2A 协议与中心中台协同,现场节点只做感知与执行。
一套 Agent 底座可快速切换业务场景(工业巡检 / 金融合同审查 / 智能客服)。