2026年4月更新日志
上线时间:2026-04
数据开发
数据同步读写支持kingbase8.6【6.2】
功能:数据同步在源端和目标端均支持选择kingbase8.6作为读写数据源

kyuubi日志优化【6.3】
背景:Spark SQL 任务已支持通过 Kyuubi 执行,以提升高并发场景下的查询效率。随着 Kyuubi 的应用,现有运行日志仅包含客户端信息,缺少与 YARN 任务关联的关键标识(如 Application ID 和 Application Name),在任务排查与运维管理过程中存在不便。
功能:针对通过 Kyuubi 执行的 Spark SQL 任务,平台对运行日志信息进行了优化。无论任务执行成功或失败,日志中均新增展示以下 YARN 关键信息:
- Application Name:YARN 应用名称,便于识别任务的业务含义。
- Application ID:YARN 应用的唯一标识,可用于快速定位对应的 YARN 任务并进行问题排查。
多模态
多模态-算子任务支持Daft分布式计算框架【7.0】
背景:Daft 作为分布式计算框架,其对接核心理由在于它专为 AI 与多模态数据场景优化,解决了传统框架在扩展性、异构资源调度和数据处理效率上的关键瓶颈。
跑通Daft任务在平台内的基本流程,实现向导/脚本模式的开发调试,并支持调度。
任务开发模式
a. 向导模式开发: 调研并确定Daft任务流的串联规则(界面配置化),确定配置项与底层代码的映射关系。
b. 脚本模式开发: 确定脚本模板,支持用户自定义Python脚本代码。
任务配置与执行
a. 基础属性配置: 调度属性(周期、时间)、任务参数(自定义、项目、全局变量)、环境参数(镜像选择)、资源参数(资源组、CPU/Memory)。
b. 依赖视图: 实现任务上下游依赖的可视化展示与配置。
c. 运行模式:
支持本地运行。
支持周期调度运行。
d. 日志与历史:
对接运行日志系统,支持离线日志拉取。
记录运行历史(实例列表、状态、耗时)并可视化展示。
内部算子集成
a. 算子引入: 将已有的内部数据处理算子封装为Daft可调用的组件。
1、html 标签移除
2、特定字符替换
3、Email 地址清理
4、空白字符标准化器
b. 算子展示: 在任务开发界面(向导模式)中展示可用算子列表。


多模态-Datajuicer算子对接控制台配置模型【7.0】
背景:datajuicer算子任务对接外部大模型,控制台集中管理外部大模型减少用户配置操作流程,便于客户集中查看和管理外部大模型。
说明
● 条件使用①:仅当参数 tokenization=True 时才加载模型,默认为 False(基于字符统计,无需模型)
● 条件使用②:仅当 tokenizer 参数指定了模型名称时才加载,默认使用字符/词级分块

涉及算子:
数字/字母占比过滤器、词语重复过滤器、文本解析分块、词数过滤器、提取事件映射器、提取关键词映射器
