2026年2月更新日志
上线时间:2026-02
数据开发
元数据同步逻辑优化【6.3】
背景:当前离线元数据同步过程中,若同步任务中存在任意一张表同步失败,系统将直接中断整体同步流程,导致后续表无法继续同步,且用户也无感知。在大规模元数据同步场景下,容易造成数据地图内元数据不完整。
功能:
- 优化元数据同步流程,支持单表同步失败不中断整体同步任务,确保其余表可继续同步,提升整体元数据同步的完整性
- 对同步至离线数据地图的数据源(Hive、AnalyticDB for PostgreSQL、TiDB、Inceptor),新增元数据同步历史记录展示,支持查看每次同步的执行结果与同步详情,包括同步成功的表及同步失败的表。


页面临时运行适配Kyuubi【6.3】
背景:在高并发使用场景下,离线 Spark SQL 任务页面的临时运行能力主要依赖单节点 Spark Thrift Server 执行,存在明显性能瓶颈,单次SQL执行耗时可达3–5 分钟,在高频调试、查询场景下影响用户使用体验。Kyuubi 作为支持多节点部署的 Spark Thrift Server,具备更强的并发处理能力和资源扩展性,能够有效提升高并发场景下的 SQL 执行效率。
功能:
- 在公共组件的Spark Thrift计算组件中新增连接方式选择,支持SparkThrift / Kyuubi两种连接方式,当选择 Kyuubi 作为连接方式时,离线 Spark SQL 任务支持通过 Kyuubi 执行临时运行查询。
- 在离线 Spark SQL 任务页面进行复杂 SQL(带筛选条件)的临时运行时,支持在本次运行配置中明确选择执行引擎,执行方式支持:
- On Yarn:通过 Spark Thrift 启动独立 Spark 任务执行
- Kyuubi:通过 Kyuubi 复用 Spark 会话执行查询


Doris创建自定义函数优化【6.3】
背景:当前Doris在创建自定义函数时,仅支持通过LOCAL PATH 的方式引用 JAR 包。用户需要手动将 JAR 包上传至所有 FE 与 BE 节点的相同本地路径,并在创建函数时手动填写该路径,整体流程繁琐、易出错,对用户操作不够友好。
功能:
- Doris组件内需先维护FE节点的SFTP账号信息,该账号用于平台在创建函数时将用户选择的 JAR 包资源分发至 Doris 集群相关节点
- 创建自定义函数弹窗内「资源」由手动填写路径调整为下拉框,和其他计算引擎的函数一致,用户仅需选择对应的 JAR 包,即可完成函数创建,无需关心底层路径与节点分发细节


任务发布支持变更表结构【6.3】
背景:在现有任务发布流程中,用户在测试项目对数据表进行结构变更(如新增字段、修改字段类型)后,将任务或数据表发布至生产项目时,表结构不会随发布同步更新。生产环境表结构变更需依赖人工手动执行 DDL 操作,不仅维护成本高,也容易因漏改、误改导致生产表结构与任务逻辑不一致,影响发布效率与数据稳定性
功能:
- 在创建发布包时,平台将记录发布包内数据表的创建 SQL,发布执行阶段基于发布包中记录的表结构信息,与目标项目中对应 Schema 下已存在的表结构进行对比。目前仅支持识别字段新增、字段类型变更结构差异
- 当发布过程中检测到目标项目中存在表结构差异,且用户勾选了相关变更选项时,在发布执行阶段平台会根据表结构差异自动生成并执行对应的
ALTER TABLESQL,将源项目中的表结构变更同步应用至目标项目 - 当前版本暂不支持对以下结构变更类型进行自动同步,相关变更仍需用户人工处理::
- 主键 / 唯一键定义变更
- 分区字段新增、删除或类型变更
- 字段删除
- 字段顺序变更
- 字段默认值或字段注释变更

多模态
算子任务支持图像类算子【7.0】
背景:为满足多模态场景下图像数据处理需求,离线开发在算子任务中新增图像类算子支持,补齐图像去重、图像筛选与人脸特征过滤等能力,帮助用户在离线任务链路中完成图像样本的标准化处理与质量过滤,提升图像数据治理与后续训练、分析的效率。
功能:
1、算子任务新增图像类算子能力,支持在算子任务中直接编排和使用图像处理算子完成数据处理。参数配置支持默认值与输入约束定义,覆盖字符串、整型、浮点型及下拉选择等配置方式,便于任务配置与执行
2、新增图像去重器 ray_image_deduplicator,支持基于图像哈希进行文档级去重,并支持 PHash、DHash、AHash、WHash 等哈希方法,可结合文本内容辅助去重与重复结果追踪。
3、新增图像大小过滤器 image_size_filter,支持按最小图像大小、最大图像大小及保留策略对样本进行筛选,支持 KB/MB/GB/TB 等单位配置。
4、新增图像长宽比过滤器 image_aspect_ratio_filter,支持按图像宽高比范围过滤样本,并支持“任意”或“全部”两种保留策略。
5、新增图像形状过滤器 image_shape_filter,支持按图像宽度、高度范围过滤样本,满足对图像尺寸的精细化控制。
6、新增人脸数量过滤器 image_face_count_filter,支持基于图像中检测到的人脸数量范围筛选样本,并支持“任意”或“全部”策略。
7、新增人脸面积占比过滤器 image_face_ratio_filter,支持按人脸区域占整图面积的比例范围过滤样本,用于控制图像主体质量与有效性。

数据同步任务写出目录层级修改【7.0】
背景:目前数据同步任务Sink端的逻辑依赖上游文件的完整路径来区分不同来源的文件层级。当上游选择多个路径进行同步时,下游会按照完整路径结构进行写入,容易导致下游目录层级过深、结构复杂,增加数据管理与使用成本。
功能:新增配置项「是否保留父目录」
1)选择“是”(保留第一层父目录): 下游在写入时,将基于上游源文件的第一层父目录进行层级区分,避免目录结构过深。若不同上游路径下存在同名文件,系统会报错并终止任务,不写入任何数据
上游路径:
/data/a/file1.csv
/data/b/file2.csv
下游目录:
/target/
├── a/file1.csv
└── b/file2.csv
2)选择“否”(不保留父目录) 下游仅使用用户指定的目标目录,所有上游选定路径下的文件将直接写入该目录,形成扁平化结构。若不同上游路径下存在同名文件,系统同样会报错并终止任务,且不写入任何数据
上游路径:
/data/a/file1.csv
/data/b/file2.csv
下游目录:
/target/
├── file1.csv
└── file2.csv

优化Minio数据同步脏数据错误信息【7.0】
背景:在现有的数据同步任务中,脏数据仅支持输出至 Hive 脏数据表。在K8S运行场景下,部分客户环境并未部署 Hive,导致脏数据无法有效记录与追踪
功能:
1、在K8S调度场景下,脏数据不再依赖 Hive,支持将脏数据记录存储至 MySQL
2、非结构化数据同步脏数据记录方式按文件维度,当单个文件被拆分为多个片段且写入失败时,仅记录一条脏数据,避免重复报错

算子任务补充文档类算子【7.0】
背景:为支撑多模态场景下文档类数据的清洗、切分、过滤、转换与信息抽取,补充上线一批文档类算子能力
功能:
1、新增文本解析分块算子,支持按最大长度、重叠长度、分割字符等参数将输入文本拆分为多个文本块,适用于长文档解析、RAG 入库前切片等场景。
2、新增中文转换映射器 chinese_convert_mapper,支持简体、繁体、港台变体及日文汉字之间的文本转换,满足多语种中文文本转换场景。
3、新增词数过滤器 words_num_filter,支持按最小词数、最大词数范围筛选样本,并支持基于分词结果统计词数。
4、新增空格归一化映射器 whitespace_normalization_mapper,支持将文本中的非标准空白字符统一规范为空格,并清理首尾空白。
5、新增词语重复过滤器 word_repetition_filter,支持配置 n-gram 长度、重复比率最小值和最大值,对词级重复度异常的样本进行过滤。
6、新增字符重复过滤器 character_repetition_filter,支持配置字符级 n-gram 长度及重复率阈值,对字符重复度过高或不符合要求的文本进行筛选。
7、新增文本正则替换映射器 replace_content_mapper,支持通过正则匹配字符并配置替换字符,实现文本内容批量清洗、脱敏和格式修正。
8、新增文本质量打分和语种识别过滤器 language_id_score_filter,支持基于 FastText 识别文本语种并计算置信度,可按语种名称和最低得分过滤样本,支持多语种文档处理。
9、新增句子分割映射器 sentence_split_mapper,支持按指定语种将文本拆分为句子列表,默认语种为 en,适用于后续句级分析和处理。
10、新增事件提取映射器 extract_event_mapper,支持从文本中提取事件及相关角色信息,提取结果写入样本元信息,适用于结构化信息抽取场景。
11、新增关键词提取映射器 extract_keyword_mapper,支持为文本生成关键词,辅助文档摘要、检索召回和内容标签生成。
