芯禾 XinheBot · 智能中台系统架构

Vue3 双端 · Django / SpringBoot 双后端 · LangGraph 3 子 Agent · vLLM 推理 · A2A 分布式集群
① 前端层 Frontend · Vue3 + Vite

PC 管理后台

完整管理端

  • 知识库管理 / 文档批量入库
  • RAG 检索调试 · Agent 任务监控
  • 多租户 RBAC 权限配置 · 报告预览

移动端 H5(Vant4)

轻量化现场作业端

  • 拍照上传 · 接收任务 · 查看 AI 结果
  • IndexedDB 离线缓存 · 请求队列
  • 弱网断点续传 · 网络恢复自动同步
▼ HTTPS / REST ▼
② 业务接入层 Backend · 双技术栈

方案 A · Django(原型)

快速迭代 / AI 原型验证

  • 业务 CRUD · RBAC 权限 · 任务管理
  • 快速迭代 Prompt 与文档解析流程

方案 B · SpringBoot(生产)

面向高并发业务接入

  • API 网关限流 · 分布式锁 · 连接池
  • 多租户隔离 · 企业级事务 · 异步任务调度
▼ HTTP / gRPC 调用 AI 中台 ▼
③ AI 中台层 AI Service · FastAPI + LangGraph

RAG · 多 Agent · 工具调用 · 模型路由降级 · RAGAS 评测

① 业务规划 Agent

任务拆解 · CoT 推理 · 会话状态管理 · 模型路由 · 断点续跑

② 文档 & 研判 Agent

RAG 向量检索 · OCR 多模态解析 · VLM 图像识别 · RAGAS 评测

③ 报告生成 Agent

多 Agent 结果汇总 · 结构化报告 · 原文引用溯源 · PDF 导出

▼ OpenAI 兼容 API · 统一推理网关 ▼
④ 模型推理层 Inference · vLLM高并发核心

Qwen / DeepSeek LLM · VLM 多模态模型 · 本地私有化部署

vLLM 推理加速

PagedAttention 分页 KV Cache · 连续批处理 Continuous Batching · 张量并行 Tensor Parallel · 增量解码,单卡吞吐提升 5-10x

高并发处理方案

请求级批处理聚合 · KV Cache 前缀复用(RAG 系统 Prompt 共享)· 多模型实例水平扩展 · 负载均衡调度 · 超时与流式 SSE 回传

降级与治理

多模型路由(Qwen → DeepSeek 自动切换)· 队列排队限流 · GPU 显存水位监控 · 失败重试 · 推理耗时 / Token 指标监控

A2A · Agent-to-Agent 协议分布式集群
⑤ 边缘机器人集群 Edge Fleet · 多地分布式部署

远端机器人 Agent 节点

现场感知 + 执行(不做 heavy LLM 推理)

  • 巡检机器人 / 无人机 · 本地图像采集
  • 弱网本地缓存 · 异常事件上报中心
  • 接收中心下发任务指令 · 执行状态回传

A2A 协议职责

中心 ↔ 远端 解耦通信

  • 能力声明 / 任务协商 / 消息格式约定
  • 跨节点状态同步 · 故障重连与幂等
  • 业务后端不直连机器人,统一走 AI 中台
▼ 读写 ▼
⑥ 存储层 Storage

MySQL

业务数据 / 多租户

Redis

异步任务队列 · 会话缓存

MinIO

对象存储 · 文档 / 原图

Milvus

向量库 · RAG 知识库

PostGIS

空间地理数据

架构要点: Java / Django 业务层只负责用户、权限、高并发接入,不写 LLM 推理与 Agent 编排; RAG、3 子 Agent 集中在 Python FastAPI 中台,通过 OpenAI 兼容协议调用 vLLM 推理服务。 高并发由 vLLM 的 PagedAttention + 连续批处理 + KV Cache 前缀复用承担,配合多实例水平扩展与限流降级。 远端机器人集群通过 A2A 协议与中心中台协同,现场节点只做感知与执行。 一套 Agent 底座可快速切换业务场景(工业巡检 / 金融合同审查 / 智能客服)。