Skip to main content

2026年3月更新日志

上线时间:2026-03

数据开发

补齐基线出错告警逻辑【6.2】

背景:当前基线告警支持完成、预警、破线、未完成等触发方式,但在基线链路任务执行异常时无法及时触发告警,用户难以及时感知基线运行风险。同时,基线首次生成实例进入监控阶段时不会发送告警,部分异常状态可能被忽略。为提升基线监控能力,本版本补齐基线出错告警逻辑。

功能:新增基线出错告警。当基线所在的有效实例链路中任务出现异常时,系统将触发基线出错告警。异常场景包括任务冻结、手动取消、自动取消、提交失败、运行失败及实例被置为失败等情况。当基线监控过程中链路任务再次发生失败时,每次异常均会触发告警。

img

任务支持克隆至业务流程【6.3】

背景:历史任务若需纳入业务流程管理,需要在业务流程中逐一新建任务并手动复制内容,操作效率低。本次优化支持快速将单个或多个任务克隆至业务流程,实现统一管理与高效操作。

功能:支持将任务单个或批量克隆至指定业务流程,仅复制任务配置信息(如 SQL、调度属性、任务参数和环境参数),不包含任务间依赖关系,实现任务快速纳入业务流程管理

img

img

角色权限点新增查询结果下载【6.3】

背景:当前对查询结果下载操作未进行权限控制,所有具备查询能力的用户均可将查询结果下载到本地,存在敏感数据被非授权用户导出的风险。为加强数据安全管控,新增查询结果下载权限控制能力,支持通过角色权限统一管理用户是否可下载查询结果。

功能:

在角色管理“数据开发-离线任务”下新增「查询结果下载」权限点,控制用户是否可以将平台页面点查询结果下载到本地

img

运行中实例支持置失败操作【6.3】

背景:在离线任务运行过程中,当任务实例运行时间异常或执行结果可能存在问题时,用户往往需要立即终止当前实例并阻止其下游任务继续运行,以避免异常数据向下游传播。此前平台仅提供以下两种实例处理方式:

  1. 终止实例:会同时将所有下游实例统一置为「已取消」,影响范围较大
  2. 置成功:当前实例会被标记为成功状态,下游任务仍会继续执行,可能导致异常数据被下游消费

上述操作均无法满足 “仅终止当前实例并阻断下游调度” 的实际需求。因此本次新增实例“置失败”操作能力,用于快速将当前实例标记为失败并阻止其触发下游任务运行。

功能:实例右键菜单新增「置失败」按钮,支持范围为周期任务、手动任务及补数据任务。点击后实例状态流转规则:

  1. 等待提交 / 提交中 → 提交失败
  2. 等待运行 / 运行中 → 运行失败,并触发底层引擎执行 kill 操作

在当前实例置失败后,不触发下游实例运行;已生成但未执行的下游实例保持「等待提交」状态。支持置失败的实例状态包括等待提交、提交中、等待运行、冻结、运行中,其他状态实例置失败按钮置灰不可点击

img

任务依赖配错提示优化【6.3】

背景:在离线开发任务提交过程中,平台会基于数据血缘对任务依赖关系进行校验,提示可能存在的依赖配置问题。但在实际使用中,原有提示存在以下问题:

  1. 缺失依赖与多余依赖未进行分类展示,问题定位效率较低
  2. 提示页面无法直接调整依赖关系,需要手动跳转任务页面,操作较为繁琐

功能:

  1. 原有依赖提示列表进行了结构优化,拆分为两个独立区域:缺失的上游依赖任务/冗余的上游依赖任务,通过分类展示,帮助用户快速定位问题类型
  2. 在依赖校验提示页面中,用户可以直接进行依赖关系调整:针对缺失依赖任务可点击「添加依赖」;针对冗余依赖任务可点击「移除依赖」。操作后前端暂存依赖关系,在提交时统一完成任务依赖关系的调整

img

多模态

离线数据同步支持K8S集群【7.0】

背景:为适配云原生架构,平台新增离线数据同步任务在 K8S 集群上的运行能力,逐步替代对 YARN 的依赖,实现统一的资源调度与弹性扩展。

功能:

1、数据同步任务支持在 K8S 上进行临时运行和周期调度运行

2、适配以下数据源作为来源或目标端:MySQL、Oracle、PostgreSQL、StarRocks、Doris、HDFS、Elasticsearch、MinIO(含 MinIO Meta)

新增 FTP 到 MinIO 的数据同步能力【7.0】

背景:为满足客户将 FTP 中的非结构化数据同步至对象存储的需求,新增 FTP 到 Minio目标的多模态数据同步能力

功能:

1、源端支持 FTP:支持从 FTP 服务器读取 PDF、图片、音视频、文档等非结构化文件。

2、目标端支持 MinIO:支持将文件写入 MinIO 对象存储的指定 Bucket 和路径,实现集中存储与管理。

img

算子任务补充文档类算子【7.0】

背景:历史版本已支持部分文档类算子能力。为进一步完善多模态场景下文档数据清洗、标准化与质量过滤链路,本次对文档类算子进行了补充和丰富

功能:

1、算子任务补充文档类算子支持,可在算子任务中直接编排文档处理算子完成数据处理。支持参数化配置,覆盖转换模式、最小/最大过滤阈值等配置项,满足不同文档清洗与治理场景下的灵活使用需求。

2、新增中文转换映射器 chinese_convert_mapper,支持简体、繁体、港台变体及日文汉字之间的文本转换,满足多语种中文文本转换场景。

3、新增词数过滤器 words_num_filter,支持按最小词数、最大词数范围筛选样本,并支持基于分词结果统计词数。

4、新增空格归一化映射器 whitespace_normalization_mapper,支持将文本中的非标准空白字符统一规范为空格,并清理首尾空白。

5、新增标点符号规范化映射器 punctuation_normalization_mapper,支持将 Unicode 标点统一映射为英文等效标点,提升文本格式一致性。

6、新增平均行长过滤器 average_line_length_filter,支持按平均行长度范围过滤文本样本。

7、新增最大行长过滤器 maximum_line_length_filter,支持按最长行长度范围过滤文本样本。

img

优化自定义参数编辑方式支持KV和文本方式【7.0】

背景:为提升算子任务中自定义参数的配置效率与可维护性,针对原有编辑方式仅适配单层参数难以满足日常开发中多层级复杂配置场景的问题,对自定义参数编辑能力进行了优化,支持更灵活的结构化与文本化配置方式

功能:

1、新增自定义参数双编辑模式,支持KV模式与文本模式按需配置,同时可以自由切换,适配不同参数复杂度场景

2、增强参数校验与错误提示能力,支持语法异常、格式错误、重复键等问题识别,降低配置风险

3、两种编辑方式的配置结果统一转换为标准 YAML 格式传递给 DataJuicer,保障参数下发一致性

img

img

离线Python组件支持Python On Ray【7.0】

背景:为支撑多模态场景下更复杂的离线分布式计算需求,平台对离线 Python 组件能力进行了增强,支持基于 Python On Ray 的任务运行方式

功能:

1、在K8S调度场景下离线Python组件新增Python On Ray支持,支持周期任务与手动任务进行任务调度与执行,扩展 Python 任务的分布式运行能力

2、支持通过环境参数方式配置Daft运行所需环境,提升运行环境配置灵活性。

img

计算组件Python&Shell命名规则统一【7.0】

背景:为提升任务运行环境的可识别性和用户理解度,对离线开发平台中的任务类型名称进行了统一规范。本次优化明确区分任务的执行引擎(YARN 集群)与运行载体(Agent),使任务配置更加直观

功能:

1、Python任务统一更名为 Python on YARN;Shell任务统一更名为Shell on YARN

2、Python on Agent 与 Shell on Agent 的命名保持不变,但与 YARN 类型形成统一的命名规范

img

离线Spark组件支持Spark On K8S【7.0】

背景:为适配云原生架构,平台新增 Spark On K8S 运行能力,使离线 Spark 任务摆脱对 YARN 的依赖

功能:

1、支持SparkSQL、PySpark、Spark Jar任务在 K8S 集群上运行,包括Spark3.2与3.5两个版本。

2、支持K8S + HDFS + S3 + NFS的混合存储架构:JAR存储于HDFS,Hive表数据存储于S3,日志文件存储于NFS

img