2026 Q3 创新激励答辩 · SNACK

从没有知识库、没有标签
到文档知识基础设施

SNACK 文档智能打标与标签治理闭环

AI 创新应用 · 技术创新
01 / WHY

起点不是“标签效率低”
而是知识基础尚未建立

原有状态
没有统一知识库
没有可复用标签

文档分散在 Wiki、知识库、会议纪要等来源中,缺少结构化的组织与发现入口。

文档增长后,靠人工逐篇整理难以持续扩展。
缺少统一标签体系,知识难以分类、检索和跨场景复用。
标签口径与质量缺乏治理,难以追溯标签从何而来、是否可信。
因此需要先把分散文档转成可治理、可发现的知识资产。
02 / INNOVATION

把 AI 打标升级为
知识标签生产与治理闭环

不是让模型直接拍板,而是让模型参与生产,再由规则、评估和治理机制把标签沉淀成可复用资产。

01 · 双链路

实时增量 + 历史冷启动

新文档及时处理,存量文档批量治理,兼顾持续增长与知识基础建设。

02 · 逐级治理

从自由标签到发布体系

候选标签经历归并、边界约束与质量评估后再发布,避免模型输出直接成为最终标准。

03 · 工程闭环

可追踪、可评估、可运行

异步任务、状态追踪、内容变化识别、质量指标与运行监控共同支撑长期使用。

03 / HOW IT WORKS

让文档逐步成为可发现的知识资产

多源文档Wiki / 知识库 / 会议纪要
→
内容理解摘要、指纹与变化识别
→
标签生产模型生成候选标签
→
治理评估归并、边界与质量检查
→
发布复用线上匹配与检索基础
线上实时增量识别文档变化,复用稳定摘要,对新增候选标签增量匹配。
线下历史冷启动批量处理已有文档,治理标签资产并开展覆盖与质量评估。

申报材料记录:服务接口、任务查询、实时打标、冷启动治理和生产部署已形成核心闭环。现场可用项目系统演示一条脱敏文档的完整流转。

04 / RESULTS

已有阶段性验证,价值持续量化中

90.6%样本标签覆盖率500 篇样本中,453 篇命中标签;离线阶段评估。
2,000专项并发请求本地修复版高并发测试全部成功;P50 约 6.1 秒,P95 约 8.0 秒。
450–495MiB RSS 平台区间本地修复版压测观测到的稳定区间,不代表生产 SLA。
口径说明:90.6% 是覆盖率,不是准确率;压测数据来自本地修复版专项验证,不等同生产 SLA。申报材料还记录了边界治理后的样本覆盖率 77.4%,用于指导标签边界优化。

答辩前建议补充:人工整理的基线耗时、实际处理规模、真实下游使用情况和可复核的前后变化;没有可靠数据时明确标为待测。

05 / WHAT'S NEXT

未来规划:从“核心闭环可用”
走向效果可证、稳定可扩、业务可复用

01 · 质量补齐效果证据

用脱敏生产样本开展单标签、多标签准确性对比,建立可重复的评估基线。

02 · 稳定收敛生产运行风险

持续验证入口并发、RSS、超时与重试,完善 OOM、重启和连接池等监控。

03 · 规模验证规模化治理

检验大规则集与文档持续增长下的批量治理耗时、失败反馈和资源消耗。

04 · 复用推动多源与下游接入

扩展文档来源和消费场景,记录接入成本、使用情况与可验证的业务改善。

TAKEAWAY
我们把文档从分散、无标签的内容,推进为能够被治理、评估、发布与复用的知识资产。

核心链路已落地;下一步用更扎实的效果数据和更多真实场景,证明它的长期价值。

谢谢