qKnow 专业版 v3.1.2 上线:文件中心无缝对接 HDFS/OSS,海量数据秒级入库!
在企业构建知识库、智能体应用和知识图谱的过程中,数据接入是影响知识应用效果的重要环节。
实际业务环境中的知识数据通常并非集中存储于单一系统,而是分散在不同的数据平台中:
- 大规模业务文档可能存储在分布式文件系统;
- 云端资料可能保存在对象存储平台;
- 历史文件可能仍通过 FTP 等方式进行管理。
这些数据虽然具备业务价值,但在进入知识库和知识图谱之前,往往需要经历文件下载、整理、上传、解析等多个步骤。
传统的数据接入方式通常是:
**第三方存储 → 本地下载 → 文件整理 → 手动上传 → 内容解析** 这一过程。

随着企业知识规模不断扩大,这种方式逐渐面临数据同步效率低、人工维护成本高、知识更新不及时等问题。
因此,企业知识管理平台需要具备更加灵活的数据连接能力,让不同来源的知识文件能够更加顺畅地进入知识构建流程。
基于这一需求,qKnow 智能体构建平台专业版 v3.1.2 围绕知识文件同步能力进行了优化升级,新增 **HDFS、OSS、FTP 等第三方存储文件同步能力**,进一步完善知识库与知识图谱的数据接入流程。
本次升级重点解决的是:
**如何降低多来源知识数据接入过程中的复杂度,让分散存储的文件能够更加高效地进入后续知识处理环节。**
---
## 为什么需要第三方存储同步能力?
在企业知识应用建设过程中,知识数据通常具有以下特点:
一方面,数据来源多样。
不同业务部门可能使用不同的数据存储方式,例如:
- 大数据平台中的业务文档;
- 云对象存储中的资料文件;
- 文件服务器中的历史归档数据。
另一方面,数据更新频繁。
知识库和知识图谱需要持续接入新的业务资料,如果仍然依赖人工下载和上传,不仅效率较低,也容易出现数据更新不及时的问题。
因此,知识系统需要具备更加灵活的数据接入能力:能够连接不同存储系统,并将外部文件快速导入知识处理流程。
qKnow 专业版 v3.1.2 针对这一场景进行了优化,通过新增第三方存储同步能力,将原本复杂的文件迁移流程简化为:
**配置数据连接 → 选择同步文件 → 导入知识处理流程** 降低了知识数据接入过程中的操作复杂度。
---
## 一、核心能力升级
知识库新增第三方存储文件同步能力
在 qKnow 专业版 v3.1.2 中,知识文档管理模块新增第三方存储同步功能。
用户可以直接在知识文档管理页面配置外部存储连接,并将指定文件同步至知识库。
整个流程主要包括两个步骤。
**第一步:配置数据连接**
用户首先需要根据实际文件存储环境选择对应的数据连接类型,并填写相关连接信息。
目前支持以下三种文件存储方式:
**1)HDFS**
HDFS(Hadoop Distributed File System)是一种面向大规模数据存储场景的分布式文件系统。
适用于:
- 大规模业务文档存储;
- 数据平台文件管理;
- 分布式数据处理场景。
通过 HDFS 数据连接,qKnow 可以直接读取分布式文件系统中的知识文件。
**2)FTP**
FTP 是传统文件传输服务,广泛应用于企业内部文件交换和历史资料管理场景。
适用于:
- 批量文件读取;
- 文件服务器数据接入;
- 历史文档归档管理。
通过 FTP 数据连接,可以将已有文件资源快速接入知识构建流程。
**3)OSS(阿里云对象存储)**
OSS 是一种面向云端的数据存储服务。
适用于:
- 云端业务资料管理;
- 图片、文档等对象文件存储;
- 云环境中的知识数据接入。
通过 OSS 同步能力,qKnow 可以直接读取云端对象存储中的文件。
通过统一的数据连接配置方式,用户可以根据自身数据环境选择对应接入方式,无需针对不同存储系统重复开发文件导入流程。

---
**第二步:选择同步文件**
完成数据连接配置后,系统会读取对应存储中的文件列表。
用户可以根据实际知识构建需求:
1. 查看可同步文件;
2. 选择目标文件;
3. 执行同步操作。
同步完成后,文件即可进入知识库后续处理流程。
相比传统方式:
**下载文件 → 整理文件 → 手动上传**
新的同步流程减少了文件在不同系统之间重复搬运的过程,使知识库能够更加直接地获取外部存储中的知识数据。

---
## 知识图谱非结构化抽取支持同步外部文件
除了知识库文件同步能力外,qKnow 专业版 v3.1.2 同时优化了知识图谱非结构化抽取流程。
在知识图谱构建过程中,非结构化文档通常需要经历:
**文件接入 → 文档解析 → 实体识别 → 关系抽取 → 图谱构建** 多个处理阶段。
其中,文件接入是整个知识抽取流程的基础。
本次升级后,知识图谱非结构化抽取模块新增第三方存储同步入口,支持通过与知识库一致的数据连接方式接入外部文件。
用户可以:
- 配置 HDFS、FTP 或 OSS 数据连接;
- 获取外部存储中的文件列表;
- 选择需要进行知识抽取的文档;
- 开始后续实体关系抽取流程。
通过这一能力,知识图谱构建过程可以直接利用企业已有文件资源,减少数据准备阶段的重复操作。

---
## 其他功能优化
除数据同步能力增强外,qKnow v3.1.2 同时针对部分功能体验进行了优化。
- **优化关系配置展示逻辑** 修复关系配置中所属模型下拉框数据展示不完整的问题,提升模型选择过程中的可用性。
- **支持不同知识图谱模型创建同名概念** 优化知识图谱模型管理能力,支持不同图谱模型中添加相同名称的概念,提高模型设计灵活性。
- **优化大模型分类展示** 优化大模型配置页面中的模型分类标题展示,使模型管理结构更加清晰。
- **提升非结构化抽取任务稳定性** 优化知识图谱非结构化抽取失败处理机制,当单个任务出现异常时,不影响其他任务继续执行,提高任务运行稳定性。
- **优化空白文段处理逻辑** 调整非结构化抽取流程,支持跳过空白文段,减少无效抽取过程,提高数据处理效率。

---
## 版本价值
对于企业智能体和知识管理系统而言,模型能力只是应用体系中的一部分,持续、高质量的知识数据供给同样重要。
当企业知识文件分布在不同存储系统中时,如何建立稳定、灵活的数据接入方式,直接影响知识库建设效率以及后续智能应用效果。
> qKnow 专业版 v3.1.2 通过新增 HDFS、OSS、FTP 等第三方存储同步能力,进一步完善了从外部文件存储到知识库、知识图谱的数据流转链路。
同时,通过优化知识图谱非结构化抽取流程以及相关功能体验,提升了平台在实际企业场景中的稳定性和可维护性。
未来,企业知识管理的发展不仅需要关注知识获取能力,也需要持续优化:
- 数据接入方式;
- 知识理解流程;
- 智能应用连接能力。
通过不断完善知识数据从接入、处理到应用的完整链路,才能让企业已有知识资源更加有效地服务业务场景。
---
原文链接:[点击查看](https://www.oschina.net/news/501979)
实际业务环境中的知识数据通常并非集中存储于单一系统,而是分散在不同的数据平台中:
- 大规模业务文档可能存储在分布式文件系统;
- 云端资料可能保存在对象存储平台;
- 历史文件可能仍通过 FTP 等方式进行管理。
这些数据虽然具备业务价值,但在进入知识库和知识图谱之前,往往需要经历文件下载、整理、上传、解析等多个步骤。
传统的数据接入方式通常是:
**第三方存储 → 本地下载 → 文件整理 → 手动上传 → 内容解析** 这一过程。

随着企业知识规模不断扩大,这种方式逐渐面临数据同步效率低、人工维护成本高、知识更新不及时等问题。
因此,企业知识管理平台需要具备更加灵活的数据连接能力,让不同来源的知识文件能够更加顺畅地进入知识构建流程。
基于这一需求,qKnow 智能体构建平台专业版 v3.1.2 围绕知识文件同步能力进行了优化升级,新增 **HDFS、OSS、FTP 等第三方存储文件同步能力**,进一步完善知识库与知识图谱的数据接入流程。
本次升级重点解决的是:
**如何降低多来源知识数据接入过程中的复杂度,让分散存储的文件能够更加高效地进入后续知识处理环节。**
---
## 为什么需要第三方存储同步能力?
在企业知识应用建设过程中,知识数据通常具有以下特点:
一方面,数据来源多样。
不同业务部门可能使用不同的数据存储方式,例如:
- 大数据平台中的业务文档;
- 云对象存储中的资料文件;
- 文件服务器中的历史归档数据。
另一方面,数据更新频繁。
知识库和知识图谱需要持续接入新的业务资料,如果仍然依赖人工下载和上传,不仅效率较低,也容易出现数据更新不及时的问题。
因此,知识系统需要具备更加灵活的数据接入能力:能够连接不同存储系统,并将外部文件快速导入知识处理流程。
qKnow 专业版 v3.1.2 针对这一场景进行了优化,通过新增第三方存储同步能力,将原本复杂的文件迁移流程简化为:
**配置数据连接 → 选择同步文件 → 导入知识处理流程** 降低了知识数据接入过程中的操作复杂度。
---
## 一、核心能力升级
知识库新增第三方存储文件同步能力
在 qKnow 专业版 v3.1.2 中,知识文档管理模块新增第三方存储同步功能。
用户可以直接在知识文档管理页面配置外部存储连接,并将指定文件同步至知识库。
整个流程主要包括两个步骤。
**第一步:配置数据连接**
用户首先需要根据实际文件存储环境选择对应的数据连接类型,并填写相关连接信息。
目前支持以下三种文件存储方式:
**1)HDFS**
HDFS(Hadoop Distributed File System)是一种面向大规模数据存储场景的分布式文件系统。
适用于:
- 大规模业务文档存储;
- 数据平台文件管理;
- 分布式数据处理场景。
通过 HDFS 数据连接,qKnow 可以直接读取分布式文件系统中的知识文件。
**2)FTP**
FTP 是传统文件传输服务,广泛应用于企业内部文件交换和历史资料管理场景。
适用于:
- 批量文件读取;
- 文件服务器数据接入;
- 历史文档归档管理。
通过 FTP 数据连接,可以将已有文件资源快速接入知识构建流程。
**3)OSS(阿里云对象存储)**
OSS 是一种面向云端的数据存储服务。
适用于:
- 云端业务资料管理;
- 图片、文档等对象文件存储;
- 云环境中的知识数据接入。
通过 OSS 同步能力,qKnow 可以直接读取云端对象存储中的文件。
通过统一的数据连接配置方式,用户可以根据自身数据环境选择对应接入方式,无需针对不同存储系统重复开发文件导入流程。

---
**第二步:选择同步文件**
完成数据连接配置后,系统会读取对应存储中的文件列表。
用户可以根据实际知识构建需求:
1. 查看可同步文件;
2. 选择目标文件;
3. 执行同步操作。
同步完成后,文件即可进入知识库后续处理流程。
相比传统方式:
**下载文件 → 整理文件 → 手动上传**
新的同步流程减少了文件在不同系统之间重复搬运的过程,使知识库能够更加直接地获取外部存储中的知识数据。

---
## 知识图谱非结构化抽取支持同步外部文件
除了知识库文件同步能力外,qKnow 专业版 v3.1.2 同时优化了知识图谱非结构化抽取流程。
在知识图谱构建过程中,非结构化文档通常需要经历:
**文件接入 → 文档解析 → 实体识别 → 关系抽取 → 图谱构建** 多个处理阶段。
其中,文件接入是整个知识抽取流程的基础。
本次升级后,知识图谱非结构化抽取模块新增第三方存储同步入口,支持通过与知识库一致的数据连接方式接入外部文件。
用户可以:
- 配置 HDFS、FTP 或 OSS 数据连接;
- 获取外部存储中的文件列表;
- 选择需要进行知识抽取的文档;
- 开始后续实体关系抽取流程。
通过这一能力,知识图谱构建过程可以直接利用企业已有文件资源,减少数据准备阶段的重复操作。

---
## 其他功能优化
除数据同步能力增强外,qKnow v3.1.2 同时针对部分功能体验进行了优化。
- **优化关系配置展示逻辑** 修复关系配置中所属模型下拉框数据展示不完整的问题,提升模型选择过程中的可用性。
- **支持不同知识图谱模型创建同名概念** 优化知识图谱模型管理能力,支持不同图谱模型中添加相同名称的概念,提高模型设计灵活性。
- **优化大模型分类展示** 优化大模型配置页面中的模型分类标题展示,使模型管理结构更加清晰。
- **提升非结构化抽取任务稳定性** 优化知识图谱非结构化抽取失败处理机制,当单个任务出现异常时,不影响其他任务继续执行,提高任务运行稳定性。
- **优化空白文段处理逻辑** 调整非结构化抽取流程,支持跳过空白文段,减少无效抽取过程,提高数据处理效率。

---
## 版本价值
对于企业智能体和知识管理系统而言,模型能力只是应用体系中的一部分,持续、高质量的知识数据供给同样重要。
当企业知识文件分布在不同存储系统中时,如何建立稳定、灵活的数据接入方式,直接影响知识库建设效率以及后续智能应用效果。
> qKnow 专业版 v3.1.2 通过新增 HDFS、OSS、FTP 等第三方存储同步能力,进一步完善了从外部文件存储到知识库、知识图谱的数据流转链路。
同时,通过优化知识图谱非结构化抽取流程以及相关功能体验,提升了平台在实际企业场景中的稳定性和可维护性。
未来,企业知识管理的发展不仅需要关注知识获取能力,也需要持续优化:
- 数据接入方式;
- 知识理解流程;
- 智能应用连接能力。
通过不断完善知识数据从接入、处理到应用的完整链路,才能让企业已有知识资源更加有效地服务业务场景。
---
原文链接:[点击查看](https://www.oschina.net/news/501979)
评论
暂无评论。