/\ Litefuse Agent 可观测与效果评估平台 面向 AI Agent 的可观测性与评估 — Observe · Evaluate · Improve 基于 Apache Doris 开源引擎构建 · Built on Apache Doris Ambrose Niu VeloDB / Apache Doris For AI · Agent Observability & Evaluation Platform 主 办 · H O S T E D BY
关于我们 · ABOUT Litefuse 出自 Apache Doris 原创团队 VeloDB 由 Apache Doris 原创团队于 2023 年 5 月创立,坚持开源 + 商业双引擎,服务全球开发者与企业。 Apache Doris 社区 自 2022 年成为 Apache 顶级项目以来持续高速增 长 Apache Doris 顶级项目 · 实时分析与检索引擎 700+ Contributors 贡献者 创始团队 1 位 PMC Chair · 9 位 PMC · 26 位 Committer 15,000+ 融资 红杉、 IDG 联合领投 GitHub Stars 总部 美国 · 新加坡 5,000+ Enterprise Users 企业用户 可观测性(日志 / Trace / 指标)正是 Doris 的核心场 景之一 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 02
01 Agent 可靠性的新挑战 为什么 Agent 没有报错、响应速度也快,却没有给出满意的结果? 软件可靠性 · 通用挑战 Agent 不确定性挑战 传统方法( TDD )可覆盖 全新的、 TDD 无法覆盖的失败模式 逻辑正确性 ! 大模型幻觉 运行健壮性 ! 工具调用失败 业务高峰压力 ! 路径规划错误 基础设施稳定性 ! 记忆腐化 (Memory Decay) Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 03
02 Litefuse 解决方案 确定性问题 TDD 已足够;面对 Agent 的不确定性,需要新方法论 — EDD ( Evaluation-Driven Development ) 为什么需要 EDD ? 非确定性 Agent 没有唯一正确答案,只能持续「评估」它好不好, 再用评估结果驱动迭代优化 —— 这就是 EDD ( Evaluation-Driven Development )。 和 TDD 最大的不同:贯穿全生命周期 TDD 主要投入在研发 / 测试阶段;而对 Agent 来说,通过开发测 试只是生命周期的开始。 EDD 贯穿开发 → 上线 → 持续迭代。 Agent 上线那一天,才是效果挑战真正的开端。 → 所以 EDD 是持续闭环,而非一次性测试 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 04
产 品 概 览 · P L AT F O R M 把 EDD 产品化 — 可观测 + 评估一体化 ◉ Observability 解开 Agent 执行黑盒 ✓ Evaluation 评估 Agent 效果好不好 SDK / OTel · AWS AgentCore 采集 离线测试数据集评估 Trace 检索与可视化 人工标注评估 100+ AI 生态集成 在线 Trace 回流评估 性能、成本等指标分析 LLM / 程序自动评估 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 05
O B S E R VA B I L I T Y 解开 Agent 执行黑盒 — 完整还原每一步 thinking → 工具决策 → 响应 每一步都在,链路完整可见 嵌套 subagent / 并行调用 多层委派关系一目了然 耗时 · token · 成本 每个 Span 真实标注 完整上下文 session / turn / 分支 / 版本 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 06
O B S E R VA B I L I T Y · 对 比 同一次 Claude Code 执行:看不全 vs 完整还原 Langfuse — 时间戳全是 0.00s 、执行图错乱、 trace 里只有工具名; Litefuse — 每一步耗时真实、上下文完整。 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 07
E V A L U AT I O N 评估 Agent 效果 — 数据集实验 + 多维打分 数据集驱动实验 对同一数据集跑不同 prompt / 模型 多个 evaluator 并行 accuracy · search quality · trajectory LLM-as-a-Judge + 人工标注 自动与人工评估结合 latency · cost 全程可比 换模型后效果与成本一起看 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 08
架 构 基 石 · F O U N D AT I O N 基于 Langfuse 与 VeloDB / Apache Doris 构建 两类难点,两个基石各解一类 — Langfuse 补功能完整性, Doris 解性能与成本 Langfuse VeloDB · Apache Doris 解决 Agent 功能难点 解决 Agent 数据难点 AI 生态多、集成复杂 ✓ 100+ AI 生态开箱对接 观测与评估割裂 ✓ 可观测 + 评估一体化 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 倒排索引 · 延迟物化 MB 级长文本,检索慢、内存高 分桶排序 · 聚簇连续存储 超长 Trace ,取全 Trace 慢 VARIANT · JSON 列存 大量 JSON 字段查询慢 存算分离 · S3 对象存储一份 数据量大、存储成本高 09
产品优势 · HIGHLIGHTS 极简轻量 · 成本更低 · 生态丰富 01 02 03 单机版极简轻量 成本大幅降低 Agent 生态丰富 安装包 < 400MB 存储成本最高降 88% 100+ AI 生态集成 无需 Docker · 25s vs Docker 138s 存算分离 + 列存 + ZSTD 压缩 大幅增加各类 Agent 对接支持 Agent 生态丰富 在 100+ AI 生态集成基础上,大幅增加个人 Agent 与 Coding Agent 对接 Claude Code Codex Cursor OpenClaw Hermes Pi MiniMax Coder Kimi Code StepClaw Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 10
/\ DEMO 在 Litefuse 上实践 EDD — 约 75 秒高光 EDD 闭环 Observe → Evaluate → Improve Demo 要点 · 评估三视角 黑盒 Black-box 只看最终输出:答案是否符合预期 灰盒 Gray-box 看执行轨迹:路径与工具选择对不对 白盒 White-box 看每一步:每一步输出是否正确 ▶ 点击播放 · 约 75 秒高光 本例教程 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 litefuse.ai/zh/guides/cookbook/example_pydantic_ai_mcp_agent_evaluation 11
03 背后的技术方案 Agent 可观测,本质是一个 实时数据分析问题 Trace 的量变,让传统可观测技术的假设失效 —— 需要为实时分析而生的引擎 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 12
查 询 模 式 · A C C E S S PAT T E R N S 三种场景,归结为 Trace 的四种查询模式 场景 1 问题排查 场景 2 效果评估 场景 3 成本分析 “这条 Trace 从哪一步开始跑偏 / 报 错?” “换 prompt / 模型后,质量与工具选择变 好了吗?” “哪个 model / 工具在烧钱, token 花在 哪?” ▼ 围绕 Agent Trace 的四种查询分析模式 1 2 3 4 Trace 元数据筛选 Trace 文本检索 Trace 点查 Trace 统计分析 按 model / status / cost / 时 间窗过滤出目标 Trace 在 input / output 长文本里按 关键字、短语定位 一次取回某条 Trace 的全部 Span ,做轨迹分析 跨海量 Trace 算 token / cost / 成功率 / P99 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 13
技术挑战 · WHY IT BREAKS Trace 数据量变,引起质变 ① 长文本 ② 超长 Trace ③ 半结构化 JSON KB → MB MB → GB 元数据 → 主数据 几十 TB → 百 TB LLM 单次 input/output 跨度几分钟到几天、数百至 input/output 主数据全是 单 Span 变大 × Span 变 达 MB 级;长文本检索慢、 数万 Span ;取全 Trace 复杂嵌套 JSON ;整段读取 多,日增百 TB ;存储与写 查询内存易撑爆 需读大量分散文件 解析效率极低 入成本数量级上升 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 ④ 数据量跃迁 14
总览 · SOLUTION MAP Litefuse · Doris 技术方案与量化收益 Agent 可观测挑战 Doris 方案 量化收益 MB 级长文本 倒排索引全文检索 + 延迟物化降内存 检索 10x 超长 Trace trace_id 分桶 / 排序 / 前缀索引,聚簇连续存储 点查 5x 大量嵌套 JSON VARIANT 自动拆子列、列存、免解析 筛选 10x 数据量跃迁 存算分离( S3 对象存储一份) + 列存 + ZSTD 成本 ↓ 75–88% 四个能力都复用 Doris 面向实时分析打磨多年的成熟机制 —— 不是为可观测临时造轮子 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 15
技术方案 · 倒排索引 倒排索引加速全文检索 对应挑战 MB 级长文本 —— 只有一张截图、没有 Trace ID ,要在 PB 级日志里按关键字反查, LIKE 越扫越慢 运行机制 1 长文本字段 input / output 2 倒排索引:词 → Span 列表 3 MATCH_PHRASE 短语检索 4 秒级返回,定位到 Trace Span 示例 SQL ( Apache Doris 语法) CREATE IN VERTED IN D EX idx_input O N spans(input) PRO PERTIES('parser'= 'unicode'); SELECT trace_id, ts FRO M spans W H ERE input M ATCH _PH RASE '生成失败 tim eout' O RD ER BY ts D ESC LIM IT 10; 关键能力 MATCH / MATCH_PHRASE / 前缀 / 词距 SLOP 正则 MATCH_REGEXP · 多字段 MULTI_MATCH 中 / 英 / IK / ICU 多语言分词 BM25 相关性打分 · SQL 与 Lucene 双语法 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 Trace 全文检索提速 10x 16
技术方案 · 聚簇存储 Trace 聚簇存储,高效点查 对应挑战 超长 Trace —— 几万个 Span 散落在成百上千个文件里,复盘一条完整轨迹要到处扫文件 运行机制 1 trace_id hash 分桶:同 Trace 落同一节点 2 文件内按 trace_id 排序、物理聚簇 3 前缀索引 + 范围 scan 定位即取回 4 一次 scan 取回整条 Trace ,不跨文件 示例 SQL ( Apache Doris 语法) CREATE TABLE spans ( trace_id STRIN G , ts D ATETIM E, ... ) D ISTRIBU TED BY H ASH (trace_id) BU CKETS 32 O RD ER BY (trace_id, ts); -- 取整条 Trace :一次范围 scan SELECT * FRO M spans W H ERE trace_id = 'tr_8f2a...'; 关键能力 trace_id hash 分桶,数据局部性好 文件内按 trace_id 排序、物理聚簇 trace_id 前缀索引快速定位 复用面向实时分析的成熟分区分桶机制 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 取全 Trace 一次 scan 5x 17
技 术 方 案 · VA R I A N T VARIANT 类型加速 JSON 分析 对应挑战 大量嵌套 JSON —— input / output 主数据全是复杂嵌套 JSON ,读取、解析整段 JSON 效率极低 运行机制 1 写入时自动识别 JSON 字段名与类型 2 拆成子列、列式存储、高压缩 3 查询只读相关子列、读取量大降 4 无需耗时的整段 JSON 解析 示例 SQL ( Apache Doris 语法) CREATE TABLE spans ( input VARIAN T, output VARIAN T ); -- 查询只读相关子列,无需解析 SELECT input['m odel'], input['usage']['input_tokens'], output['tool_calls'] FRO M spans W H ERE input['m odel'] = 'opus-4'; 关键能力 写入自动拆子列 · 高压缩 schema 漂移自适应 查询只读相关子列,读取量大降 input/output 收益比 metadata 更大 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 Trace 元数据 / 数据筛选 10x 18
技术方案 · 存算分离 存算分离,降低存储与写入成本 对应挑战 数据量跃迁 —— 单 Span 变大 × Span 变多,原始数据量与存储成本都翻了一个量级 Apache Doris · 存算分离 AWS S3 对象存储 × 1 份 -- 存算分离:数据只存对象存储 1 份 CREATE STO RAG E VAU LT s3_vault TYPE = S3 (...); -- 列存 + ZSTD 压缩,进一步降空间 ALTER TABLE spans SET('com pression'= 'zstd'); 数据只存 1 份,无需多副本 列存 + ZSTD 压缩,进一步降空间 写入只写一次,省计算与 IO 存储 / 计算独立弹性扩展 份数 ↓ 50% × S3 单价 25–50% 总成本 ↓75–88% 生产验证:倒排索引自 2023 年起在 MiniMax 、阶跃星辰、字节、快手等 PB 级场景运行 · 百 GB/s 写入 · 秒级检索 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 19
产 品 形 态 · G E T S TA R T E D 三种产品形态 · 从 litefuse.cloud 快速开始 Open Source Enterprise Cloud 开源免费 企业自建 云上托管 ✓ 单机版 · 极致简洁轻量 ✓ 深度优化 · 成本节省 80% ✓ 免维护 · 开箱即用 ✓ 分布式版 · 成本节省 50% ✓ 企业级特性 Coming Soon ✓ litefuse.cloud · VeloDB Cloud 300+ 10 万条 / 月 ≈27 对话 / 小时 用户 · 上线一个月自发注册 开发者够用的免费额度 10 万 / 30 天 / 12 小时 / 10 从 litefuse.cloud 快速开始 Litefuse · Observability & AIOps Immersion Day · Tokyo 2026 20
主 办 · H O S T E D BY /\ Litefuse 基于 Litefuse ,构建可靠的 Agent 用 EDD 把「不确定」变成「可观测、可评估、可优化」 litefuse.ai litefuse.cloud github.com/apache/doris 官网 · 文档 免费云上托管 背后的引擎 doris.apache.org P O W E R E D BY 谢谢 · Thank You | Ambrose Niu · VeloDB / Apache Doris velodb.io