下一代运维平台 , 终于有人开源了。

lxiol

原文链接:https://mp.weixin.qq.com/s/9-aQe1ca8Kr6s95200-YcQ

做运维的人都知道 。

应用一上线,性能问题就开始接踵而来。响应慢、错误率飙升、服务拓扑一团乱麻。

光是定位哪个服务慢了、哪条 SQL 耗时高、哪次调用拖垮了整条链路。

就得在指标图表、Trace 列表、拓扑图之间来回切换。

最近在 GitHub 上刷到一个项目,感觉能省不少事。

它叫 DataBuff 。

它就是一个基于 OpenTelemetry 的 APM 平台,和 Datadog、SkyWalking 差不多,服务、链路、拓扑、指标这些都能直接查看,排查问题也方便得多。

但是不同的是,它里面有一个AI大脑。

直接用自然语言问一句“order-service 错误率突然升高,是什么原因?”它就可以自动拉取指标、Trace、拓扑,给你一个诊断结论。

有趣的是,它不是外挂一个聊天框,而是让 AI 直接读取遥测数据,并根据真实数据来作答。

我给你演示一下,你就知道这个东西有多方便了

假设我要排查 service-a 响应变慢的原因。直接在AI平台上输入:

service-a 最近响应时间怎么样?

它就开始查指标。

AI 自动获取 service-a 的响应时间趋势,平均为 240 毫秒,发现最近1小时平均响应有点问题。

然后看拓扑。

显示了service-a调用了service-g,而service-g又连接到了[mysql]dcgl数据库节点。

然后找到执行速度慢的SQL。

在接口调用分析中,按照响应时间从大到小排列,可以发现 SELECT * FROM history LIMIT ? 这个查询花费的时间最长,平均为 1.03 秒。

最后点击图表下钻Trace。

点击耗时最大的地方,进入Trace列表中找到根因Span,确认是这条SQL拖垮了整个链路。

把应用性能监控中最重要的部分全打通了

01 AI 原生排障。

和别的APM只挂一个聊天框不同,DataBuff的AI会直接查询Trace、指标、拓扑、告警。

平台内含“AI大脑”、“智能问数专家”、“巡检专家”三个层次。

复杂的可以由多个专家同时进行合作,最后得出一个诊断报告。

02 OpenTelemetry 原生支持。

按照OTLP标准,Ingest服务暴露了gRPC 4317和HTTP 4318端口。

应用侧只需要配置Exporter指向后端地址,不需要绑定专用Agent。

支持任意的OTel SDK或者自动插件。

03 服务拓扑自动绘制。

根据Trace中Span父子关系来自动画出服务和中间件的依赖图。

用不同的颜色来表示健康状况(红、黄、绿),可以很快地发现是哪个服务或者组件出现了问题。

不需要手工维护CMDB。

平台可以自动识别出虚拟服务节点的类型,中间件维度更加清晰。

04 慢SQL一键定位。

数据库详情页的慢 SQL Tab,按照调用次数排序,可以快速找到性能瓶颈。

点击SQL行可以跳转到接口调用详情或者Trace,实现双向验证。

确定是不是这条语句导致了整个链路变慢。

05 告警闭环和智能巡检。

告警模块支持阈值和突变检测规则,每分钟对核心服务指标进行一次评估。

触发之后记录告警事件,指标恢复之后自动标记为已解决。

AI巡检专家还可以主动发现服务异常,降低漏报率。

告警详情页可以自动追问根因,AI 自动查数据并给出诊断,不需要人工去翻图表。

看完这些功能,相信很多人已经想试试了

Docker 一条命令就可以跑起来,从执行命令到看到 Demo 数据大约 5 分钟:

1
`curl -fsSL https://databuff.ai/databuff/ai-apm-install.sh | bash`

安装完毕后,访问 http://YOUR_HOST:27403,默认账号为 admin,密码为 Databuff@123。

如果要试用Demo应用的话,再安装一个:

1
`curl -fsSL https://databuff.ai/databuff/ai-apm-demo-install.sh | bash`

Demo 会一直向 Ingest 报告模拟的 Trace,打开 UI 就可以看到服务拓扑和链路追踪。

结构非常简单,只有三个主要部分:Ingest(接入)→ Doris(存储)→ Web(平台)。

与传统的APM多组件栈相比,运维成本大大降低。

到这里注意事项给大家提一下

目前只支持OpenTelemetry和SkyWalking两种协议。

如果使用了Pinpoint、Zipkin等专用Agent的话,就需要通过Collector进行转换。

MVP 版本没有独立的 MCP API Token,安全上依靠内网或者 VPN 来隔离。公网暴露请自己加网关或者防火墙。

告警通知(Webhook、邮件等)还没有实现,要等后面的版本。目前主要是记录告警事件,在指标恢复之后会自动标记为已解决。

写在最后

我也经常排查应用性能问题,感觉DataBuff真的可以改变排障的工作流程。

以前想要知道哪个服务慢、哪条SQL耗时高,就要在指标图表、Trace列表、拓扑图之间来回切换。

折腾了半天才找到问题所在。

现在直接问AI一句,就可以得到一份诊断结论,节省下来的时间就可以专注于打磨内容了。

有需要的朋友可以装上试试。

项目基于 AGPL-3.0  协议开放,感兴趣的同学可以去 GitHub 仓库看看源码和文档。

开源地址:https://github.com/databufflabs/databuff

官网:https://databuff.ai

既然看到这了,欢迎随手点赞、在看、转发,也可以给我个星标⭐,接收最新的文章,我们下期见!

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: 下一代运维平台 , 终于有人开源了。
  • 作者: lxiol
  • 创建于 : 2026-07-17 11:48:07
  • 更新于 : 2026-07-17 11:48:07
  • 链接: https://blog.lxiol.cn/2026/07/17/下一代运维平台-终于有人开源了/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。