2026年1月更新日志
上线时间:2026-01
数据开发
Parquet/ORC格式新增字段兼容历史分区【6.3】
背景:在数据同步任务中,当使用 Parquet 或 ORC 格式的表执行
ALTER TABLE … ADD COLUMNS 操作后,新增字段仅会写入后续新生成的分区文件,历史分区对应的 Parquet / ORC 文件中仍然不包含该字段,导致在数据同步任务无法从历史分区文件中解析到新增字段。
功能:针对新增字段,按文件实际 Schema 进行兼容处理
1)历史分区文件不包含新增字段:该字段读取结果自动补为null
2)新分区文件包含新增字段:按文件中的实际字段值正常读取
数据同步读写支持OceanBase for oracle 3.2.x【6.2】
功能:数据同步在源端和目标端均支持选择OceanBase for oracle 3.2.x作为读写数据源

多模态
算子任务支持文档类算子【7.0】
背景:为满足多模态场景下文档数据清洗、标准化与质量过滤需求,离线开发在算子任务中补充文档类算子能力,支持在离线任务链路中直接完成文本转换、内容规范化及文本质量筛选,提升文档类数据处理效率与数据可用性
功能:
1、算子任务补充文档类算子能力,支持在多模态任务中直接编排更多文本清洗与标准化算子,同时支持参数化配置,覆盖 Unicode 规范化模式、替换字符、文本长度阈值等配置项,满足不同文档治理场景下的灵活使用需求。
2、新增文本标准化算子 fix_unicode_mapper,支持修复文本中的 Unicode 异常,并按 NFC、NFKC、NFD、NFKD 等规范化模式统一文本格式。
3、新增链接清理映射器 clean_links_mapper,支持识别并清理文本中的 http、https、ftp 等链接信息。
4、新增 Copyright 清理映射器 clean_copyright_mapper,支持清理文本开头的版权声明及相关注释内容。
5、新增文本长度过滤器 text_length_filter,支持按最小长度、最大长度范围筛选文本样本。
6、新增 html 清理映射器 clean_html_mapper,支持将 HTML 内容清洗为纯文本,提升文档正文可读性与后续处理效果。
7、新增邮箱清理映射器 clean_email_mapper,支持基于正则规则识别并清理文本中的邮箱地址。
8、新增 IP 清理映射器 clean_ip_mapper,支持识别并清理文本中的 IPv4、IPv6 地址信息。

算子任务支持自定义算子名称【7.0】
背景:为提升算子编排流程的可读性与开发效率,平台新增算子节点自定义命名及复用能力
功能:支持对算子节点进行重命名,自定义业务语义名称。对同一任务画布内对算子节点进行复制粘贴,快速复用已有配置

控制台K8s资源调度组件资源管控【7.0】
背景:为在资源有限的情况下提升算子任务在 K8s 集群下的资源管控能力,离线完成对控制台 K8s 资源管理能力的接入。通过资源组与资源参数联动配置,重点任务可按指定资源组运行,并灵活配置 CPU、GPU、内存等资源参数,提升资源分配的精细化管理与关键任务保障能力
功能:
1、算子任务支持接入资源组能力,可基于控制台授权结果选择可用资源组运行任务
2、算子任务支持切换资源组,并同步调整 CPU、GPU、内存等资源参数,满足不同任务场景下的资源配置需求
3、算子任务支持查看资源组水位线,覆盖 CPU、GPU、内存三类资源,便于用户评估当前资源使用情况与负载水平



支持算子任务调试【7.0】
背景:针对算子任务仅支持整链路运行、缺少中间结果与节点级排查能力的问题,新增算子任务调试能力。通过将任务链路按算子拆分执行,支持对中间数据、运行日志和节点状态进行更细粒度的查看与定位,降低复杂链路下的调试成本。
功能:
1、新增算子任务调试模式,支持区分“运行”和“调试”,满足正式执行与问题排查的不同诉求
2、支持整任务调试运行,可按算子拆分执行并展示最近一次调试状态,覆盖全部成功、部分成功、全部失败、运行中等状态
3、支持节点级调试操作,提供“运行当前节点”“从当前节点开始运行”“运行至当前节点”等能力,提升局部排查效率
4、支持按算子输出调试日志与运行结果,用户可查看最近一次节点日志及中间数据结果
5、支持调试运行历史展示,区分调试记录与正式运行记录,便于追踪任务执行过程



