关于本 DemoPOC 分层说明 —— 哪些是真跑,哪些是设计呈现
上传标书 PDF → 浏览器本地解析文本(pdf.js)→ 关键词召回上下文 → 真实调用 LLM API → 结论与耗时留档,支持人工核对并统计一致率。商务标 6 项(报价大小写、最高限价、业绩时间、承诺工期、签字盖章、资质等级)+ 技术标 4 项(总建筑面积比对、容积率测算、规范引用核查走 LLM;专业章节完整性走本地规则引擎)。
其余 22 项检查点、技术标图纸参数(多模态,规划下一期)、报告生成与追溯页面为演示数据,用于呈现完整产品形态:28 项检查点体系、全自动/半自动/全手动分类策略、强制复核与合规追溯机制。
功能模块
审查方式分类策略
按 4 个维度加权评分,将每条审查条款划分为「全自动 / 半自动 / 全手动」
| 评估维度 | 权重 | 说明 |
|---|---|---|
| 风险等级 | 40% | 触发废标、高金额偏差等高风险项强制复核 |
| 规则明确性 | 30% | 规则越明确,越适合全自动审查 |
| AI 置信度 | 20% | 置信度 <90% 转人工复核 |
| 数据可用性 | 10% | 外部数据可联网核验程度 |
LLM 模型选型(规划:全私有化部署)
| 任务环节 | 推荐模型 |
|---|---|
| 文件解析 | 智谱 ChatGLM3-6B-128K |
| 商务条款审查(逻辑推理) | DeepSeek-R1 / 通义千问 |
| 报告生成 / 文案润色 | 通义千问(本地版) |
| 图纸参数提取(多模态) | Qwen2-72B(昇腾优化版) |
| 规则兜底 | 自研规则引擎 |
POC 阶段:直接调用云端 API(DeepSeek / 智谱 / 通义任选),Key 仅存本机。
真实 AI 审查 真实链路PDF 本地解析 → 真调 LLM → 结论留档可核对
测试标书/ 目录下 3 份自编测试标书(A 完全合规 / B 报价大小写不一致 / C 业绩超期+资质不足),或各地公共资源交易平台公开发布的文件。API Key 仅保存在本机浏览器 localStorage,不会上传。
python proxy.py 并勾选「走本地代理」。测试标书位于 测试标书/ 目录。工程要点:长文档按检查点关键词召回上下文窗口(RAG 极简形态,控 token 成本、提命中率)· 6 项并发调用 + 逐项渲染 · 结构化输出约束(JSON mode)· 线上部署时将隐藏 Key 入口并强制走代理(代码内
DEPLOY_MODE 开关)。| 检查点 | 审查内容 | AI 结论 | AI 判断依据 | 耗时 | 人工核对 |
|---|
演示模式 演示数据完整 28 项检查点流程呈现(剧本数据,非真实 AI 输出)
28 项核心检查点 蓝色「真实链路」= 可在上方真跑 · 灰色「演示数据」= 设计呈现 · 点击行展开依据
| 检查点 ID | 类别 | 审查内容 | 审查方式 | 链路 | 结论 | 操作 |
|---|
真实 AI 审查 真实链路指标提取与比对走 LLM · 章节完整性走本地规则引擎(规则兜底演示)
脱敏技术标/ 目录下的两份文本测试。| 检查点 | 审查内容 | 引擎 | AI 结论 | 依据 | 耗时 | 人工核对 |
|---|
图纸参数提取与招标要求比对 演示数据
| 参数项 | 图纸提取值 | 招标要求 | 比对结论 | 置信度 |
|---|---|---|---|---|
| 总建筑面积 | 35,000 ㎡ | 35,000 ㎡ | ✔ 一致 | 98.2% |
| 建筑高度 | 48 m | 限高 ≤50 m | ✔ 符合 | 97.6% |
| 建筑层数 | 地上 5 层 | ≤6 层 | ✔ 符合 | 99.1% |
| 容积率 | 2.4(24,000/10,000) | ≤2.5 | ✔ 满足 | 98.8% |
| 绿地率 | 32% | ≥30% | ✔ 满足 | 96.9% |
| 图纸与文本一致性 | 柱网 8m×8m / 文本 8m×8m | 偏差 ≤5% | ✔ 一致 | 99.0% |
技术方案响应性审查 演示数据
| 审查项 | 结论 | 方式 |
|---|---|---|
| 方案针对招标 10 条要求逐条响应 | 是 · 逐条响应 | 半自动 |
| 是否引用已废止规范 | 否 · 均为现行版本 | 全自动 |
| 是否违反强制性条文(消防分区 800㎡≤1000㎡) | 未违反 | 全手动 |
| 承诺设计周期 55 天 ≤ 招标要求 60 天 | 满足 | 全自动 |
规范引用核验(对接规范库) 演示数据
| 引用规范 | 状态 |
|---|---|
| 《建筑设计防火规范》GB50016-2014(2018 年版) | 现行有效 |
| 《建筑结构荷载规范》GB50009-2012 | 现行有效 |
| 《绿色建筑评价标准》GB/T50378-2019 | 现行有效 |
| 《博物馆建筑设计规范》JGJ66-2015 | 现行有效 |
商务标合规性审查报告
一、项目与投标人信息
招标项目:深圳红树林湿地博物馆方案设计(投资额 1,921 万元)
投标人:华筑设计集团有限公司 · 资质:建筑行业(建筑工程)甲级
审查范围:商务标文件共 132 页,28 项核心检查点
二、审查结论汇总
三、不通过 / 风险项明细
四、人工复核记录
五、审查结论
本报告基于演示数据生成,用于呈现报告版式与依据链结构;真实链路审查结果见「商务标审查」页实测记录。
建筑设计任务书生成
| 参数 | 取值 |
|---|---|
| 建筑类型 | 文化建筑 · 博物馆 |
| 用地面积 / 建筑面积 | 2.0 万㎡ / 3.5 万㎡ |
| 核心指标 | 容积率 ≤1.5 · 建筑密度 ≤30% · 绿地率 ≥30% |
| 特殊要求 | 绿色建筑三星级 · 无障碍设计 |
同类项目调研报告生成
| 检索命中案例 | 关键指标 | 参考价值 |
|---|---|---|
| 广州大剧院 | 容积率 6.0 · 高 250m | 高 |
| 深圳湾科技生态园 | 建筑面积 50 万㎡ | 高 |
| 国家海洋博物馆 | 双层呼吸幕墙系统 | 中 |
项目总结报告生成
自动提取项目概况、关键里程碑、成果与亮点、问题与经验、入围方案、专家评审意见摘要,沉淀知识库供后续项目检索复用。
操作追溯时间线
为什么有这个模块
在弱模型时期(如 6B 级本地模型),让模型稳定输出严格的「是/否」判断需要多轮提示词迭代优化。 本模块用与当年相同的 28 个核心检查点测试集(JSONL:question / context / answer), 按当年四个关键轮次的提示词配置实时调用当前模型复测,真实测量每一轮的准确率与格式合规率—— 既还原历史情形,也直接验证「基座能力提升后,同样的测试集表现如何」。
当年迭代决策记录(源自技术验证文档)
| 轮次 | 发现问题 | 原因分析 | 决策 | 当年结果 |
|---|---|---|---|---|
| 第 1 轮 | 模型输出长篇解释 | 指令未有效传递 | question 中嵌入严格系统指令 | 开始出现「是」,仍带解释 |
| 第 4 轮 | 准确率仅 50%(随机水平) | 缺乏上下文信息 | 为所有检查点补充上下文 | 准确率升至 78.6% |
| 第 6 轮 | 标准答案与上下文矛盾 | 标注逻辑错误 | 修正 2 个样本的标准答案 | 准确率升至 92.9% |
| 第 9 轮 | 否定问题理解错误 | 上下文否定信号弱 | 上下文中添加明确结论 | 准确率 96.4% |
| 第 10 轮 | — | 达到目标 | 确认验证通过 | 100% 准确率,格式完美 |
实时复测 真实链路选择轮次配置 → 对 28 个样本逐一真实调用 → 统计准确率/格式合规率
python weak_model_server.py,CPU 推理较慢,一轮约几分钟——这正是当年需要 GPU 工作站的原因)。评测记录计入合规追溯。| ID | 类别 | 检查点 | 标准答案 | 模型输出 | 判定 | 格式 | 输出摘录 |
|---|