为生产级数据流水线而生
从笔记本上的单个二进制,到经过审计的机群发布。
高性能
Rust + Tokio,列式 Apache Arrow 数据模型。算子融合为链——流水线内部没有跨通道跳转。
默认持久化
每条消息在处理前先 fsync 到预写日志。游标只按最高连续确认序列号推进。
可选精确一次
Kafka 事务输出端到端消除重复窗口。检查点状态将作业恢复到一致切面。
用 SQL 处理
DataFusion 驱动的 SQL、窗口函数、Python UDF 与 VRL 变换——另有 Protobuf、Debezium CDC 与 Schema Registry 编解码器。
机群控制平面
Hub/Agent 架构,期望状态语义、调和机制、可审计的发布流程,以及带作业 DAG 编辑器的 Web 控制台。
同一内核,任意拓扑
流与分布式作业编译为同一 JobSpec。你只需声明 输入 → 缓冲 → 处理器 → 输出,其余交给内核。
一份配置,贯穿全链路
接入
KafkaHTTPMQTTNATSPulsar
处理
SQLPythonVRL窗口
投递
SQLKafkaRedisInfluxDBS3 WAL
✓ 处理前先落 WAL 持久化✓ 默认至少一次,可选精确一次✓ 检查点、崩溃、恢复
深入引擎内部
流与分布式作业编译为同一 JobSpec,运行在同一个执行内核上。批次保持持久,SQL 承担重活,输出保持有序——同时 Hub/Agent 控制平面守护整个机群。
加入 ArkFlow
ArkFlow 是基于 Apache-2.0 的开源项目,已收录进 CNCF Landscape。欢迎贡献代码、提交 Issue 与分享想法。