Skip to main content

2025年12月更新日志

上线时间:2025-12

产品整体

表生命周期统一【5.2】

背景:同一张表在多个子产品中各自维护生命周期设置,容易出现配置不一致的情况。例如离线项目设置为 10 天,而资产中心设置为 5 天,可能因较短配置被优先生效而导致数据被提前清理,存在数据丢失风险。

功能:离线平台统一通过业务中心 SDK 维护表生命周期,不再在本地记录。系统将根据"数据源 ID + schemaName + tableName"判断表是否存在:

  • 表已存在 → 执行生命周期“更新”;
  • 表不存在 → 执行生命周期“插入”。

通过统一管理生命周期,确保多子产品间的配置一致性,降低业务数据风险。

数据开发

同小时间任务依赖逻辑优化【6.3】

背景:交易类业务对任务链路的时效性要求高,多采用小时级调度。由于上游数据生成或读取可能延迟,数开人员经常需要临时调整下游任务的计划时间,以保证整体链路顺利推进。但在现有逻辑下,系统会优先依赖“最近的上游实例”,当计划时间频繁变动时,容易导致依赖错位:如下游任务提前触发或无法按期依赖上游,进而影响任务链路的稳定性和准确性。

功能:

1、依赖周期交互优化

选择「自定义」时新增依赖方式下拉项:

1)基于默认依赖周期的偏移(默认),支持配置偏移量和偏移方向;

2)优先寻找同小时的上游实例,仅当前任务和上游任务均为小时调度时可选;任一方为非小时调度(分钟/天/周/月/Cron/自定义)时,该选项置灰不可选

2、新增逻辑“优先寻找同小时的上游实例”

统一匹配规则:优先匹配同小时实例;若同小时无可用实例 → 自动回退至最近时间的上游实例

适用于 3 类时间间隔场景(参考下方实例依赖图):

任务A与任务B间隔一致:

同小时匹配:B 11:30 → A 11:50;回退匹配:B 10:30 → A 前一天 14:50

任务A间隔小于任务B:

同小时匹配:B 15:30 → A 14:50;回退匹配:B 20:30 → A 16:50

任务A间隔大于任务B:

同小时匹配:B 10:50 → A 10:30;回退匹配:B 12:50 → A 10:30

img

img

img

计算引擎支持GaussDB 9.1【5.3】

功能:支持GaussDB 9.1版本计算引擎,适配功能包括周期任务、语法提示、数据同步、手动任务、临时查询、函数管理、存储过程、任务上下游参数

数据同步读写支持GaussDB 9.1【5.3】

功能:数据同步在源端和目标端均支持选择GaussDB 9.1作为读写数据源

img

运维中心

告警触发条件新增未按计划时间运行【6.3】

背景:在离线调度场景中,部分任务可能因上游延迟、资源紧张或调度异常等因素无法在计划时间按时启动,长期处于“等待运行”状态。如果未能及时发现,将导致后续依赖任务连续阻塞,影响整体任务链路的稳定性和及时性。

功能:在告警规则中新增触发方式未按计划时间运行。当任务超过计划时间的指定延迟阈值仍未开始运行时,系统将自动触发告警并发送通知,便于及时发现并处理异常

img

支持配置任务实例默认并发数【6.3】

背景:当前任务实例的并发数默认不做限制。对于集群资源紧张的环境,若用户一次性触发大量实例运行,可能会因误操作导致资源被瞬间耗尽,因此需要提供实例并发数的限制能力,保证集群资源的稳定。

功能:新增支持为补数据任务和手动任务配置「最大并行实例数」的默认值,用户可根据实际需求进行调整。

img

操作设置布局调整【6.3】

背景:当前操作设置包含调度、任务管理、界面展示等多类功能,随着系统能力持续扩展,配置项数量不断增加,原有的铺开展示方式已不利于用户快速查找和配置,影响操作效率

功能:对操作设置页面进行重新布局,按照数据同步、SQL任务、调度、通用四个模块分类展示

img

多模态

新增算子任务类型,包括向导模式和脚本模式【7.0】

背景:为提升离线在多模态非结构化数据处理场景下的任务构建效率与流程可用性,新增算子任务类型,支持向导与脚本两种构建模式,用户可以在数据集接入、流程编排、任务调度以及运维等关键环节实现统一管理,提升多模态数据处理 Pipeline 的构建效率与管理能力

功能:

1、新增算子任务类型,支持基于Data-Juicer或自定义算子框架配置,适用于多模态数据处理场景,并支持单任务创建,同时已适配工作流与业务流程编排

2、提供可视化向导与 Data-Juicer YAML 脚本两种任务构建方式,并支持向导任务一键转换为脚本配置,提升灵活性与复用性

3、向导模式中支持读数据集、写数据集及各类处理算子的自由组合,并在任务提交与运行前自动校验节点连线、必填参数、算子数量及连线方向等配置

4、支持以MinIO 元数据文件路径或资产数据集作为输入来源,并将处理结果输出至资产数据集,实现数据处理结果的资产化管理

5、支持资源组选择,并覆盖 CPU、GPU 等资源配置场景,满足不同计算需求

6、支持配置任务间上下游依赖关系,将数据同步任务与算子任务组合后,可串联“数据同步 → 数据集构建 → 算子处理 → 结果输出”的端到端数据处理链路

7、支持算子任务以单任务或工作流方式接入调度引擎,实现周期性运行,并提供补数据、编辑、下线、冻结与解冻等常用操作

8、算子任务实例中可查看任务YAML代码,以及实例列表、运行状态、失败次数、业务日期、计划时间、优先级及跨周期依赖等信息,并提供日志查看、重跑、置成功等运维操作

9、支持任务编辑、克隆及克隆至工作流等操作,提升任务复用效率

img

img

img

img