Incident Lake 对谈|ClickHouse篇(下篇)
从数据与事件管理切入,探讨AI时代SRE的发展方向

在上一篇文章中,我们介绍了SIGQ将Incident Lake的数据基础架构迁移至ClickHouse的背景,以及支撑AI企业基础设施的ClickHouse的技术特点。在这个每天都有拍字节级数据更新的时代,商业决策与运维管理将会发生怎样的变化呢?本文将以ClickHouse联合创始人兼CTO Alexey Milovidov先生(以下简称Alexey)与SIGQ代表董事金筑先生的对谈后半部分为基础,探讨以数据驱动决策为前提的“AI时代的SRE”。
本文是对谈文章的下篇。下篇请参阅《SIGQ为何从BigQuery迁移到ClickHouse》。
跨越事件管理与商业智能的界限——Agentic Analytics开辟的未来
Q. SIGQ将Incident Lake称为“事件情报层”。它与传统的事件管理工具有哪些不同之处?
金筑:传统的事件管理工具主要关注开发团队中的每位成员。然而,诸如收集错误日志和服务器指标等技术性工作,在整个事件管理活动中仅占很小的一部分。
我认为最大的挑战在于如何处理整个事件流程。事件处理人员在确认对用户和服务的影响范围的同时,还需要综合考虑业务影响,从而制定应对方案。这些工作不仅仅是简单的日志分析,而是极接近业务决策的领域。
Alexey:这样看来,可以说Incident Lake所涉足的领域,是可观测性与业务分析相结合的领域。这难道不意味着需要同时处理业务指标和技术指标这两方面的数据吗?
金筑:您说得对。例如,可以将CRM和合同管理工具中的数据结合起来,计算因违反SLA而造成的影响程度。
Alexey:此前,为了跨所有数据源进行分析,人们不得不费力编写SQL查询语句;但今后,只需用自然语言提问,就能获得答案。为此,确保AI代理能够访问所有相关数据将变得越来越重要。
然而,这又引发了一个新问题。人类编写查询的速度,即使很快,也仅为每分钟一次左右,而AI代理却能轻松地在每分钟内执行数十次查询。随着AI代理的出现,实时数据库的重要性愈发凸显。
问:作为此类AI驱动应用程序的基础,ClickHouse确实是最佳选择。AI代理似乎也将给数据分析领域带来巨大变革。
Alexey:这种由AI向分析数据库发出查询以回答问题的做法,被称为“Agentic Analytics”。该方法也可应用于商业智能(BI),如今,如果传统BI工具不集成AI代理,就可能面临过时风险。
同样的思路正逐渐扩展到可观测性领域,例如事件响应、RCA(根本原因分析)、安全调查和网络监控等。请回想一下几年前的事件响应情况。大家当时大概都是盯着成千上万张图表,试图从中找出异常。好不容易费劲地手动配置了告警规则,结果又被海量的告警所困扰。想要调查日志,却不得不从摸索该搜索什么内容开始。那应该就是这样一连串的重复性工作。
如今,这些工作中的大部分已由AI代理代为完成。这便是所谓的AI-SRE。只需输入一条提示,系统便会返回初步的分析和解决方案。甚至可能无需任何提示,AI就能自主完成从异常检测到调查、解释直至解决的整个流程。
工程师今后依然不可或缺——支撑AI时代“人类决策”的数据
问:在以往的数据分析和情报工作中,一直存在一个难题,即无法将收集到的海量数据恰当地用于决策。人工智能代理似乎能为解决这一问题提供巨大帮助。然而,这样一来,人类还能发挥什么作用呢?
Alexey:我们试图解决的问题正变得越来越复杂。得益于人工智能,我们不再需要为琐碎的问题和基础设施维护工作所困扰,从而能够投入更多精力处理其他事务。由此产生了想要完成更多工作的需求。随之而来的是,当前的工作正朝着更高层次的方向发展。
然而,无论收集了多少数据,最终决定如何行动的还是人。虽然AI智能体可能会提出许多假设,但判断前进方向的责任仍在于员工和管理者等人类。
有时,为了排除错误的假设或毫无意义的回答,必须调动自己所有的经验。AI代理虽然能提供行动的契机,但其指引的方向往往并不准确。例如在故障响应现场,如果由经验丰富的SRE提供提示,AI就能发挥出极佳的效果。反之,如果缺乏生产环境实际工作经验的人试图解决故障,则很容易直接采纳AI给出的错误答案。正因如此,工程师仍需在活用既有经验的同时,持续学习进步。
金筑:我基本上同意Alexey的观点。一旦做出决定,就必须有人为这一判断承担责任。例如,当做出“数据库已损坏,必须更换”这类重大决策时,就必须承担与之相称的重大责任。因此,在目前的情况下,我认为特别是与事件管理密切相关的艰难决策,应当由人来做出。
不过,在决策支持方面,AI能够发挥巨大作用。当今面临的挑战在于,如何从积累的海量数据中筛选出关键信息,从而加速决策过程。因此,Incident Lake通过实时RAG、决策支持、自动报告等多种功能,充分利用了大型语言模型(LLM)。它既能帮助理解情境,又能生成决策所需的执行摘要,从而在支持人类决策方面发挥重要作用。
另一方面,大型语言模型(LLM)往往会出现“幻觉”现象。在进行准确分析时,特别是在事件响应过程中,必须切实抑制这种“幻觉”。否则,将导致客户信任的丧失。因此,尽管Incident Lake在生成报告和总结情况时使用了LLM,但在计算事件严重程度等方面,仍会结合使用传统机器学习技术。
推动业务增长的关键在于赢得用户的信任
Q.既然提到了“信任”这个词,我想在此转换一下话题。SIGQ已开始正式进行融资,正稳步为实现快速增长做准备。因此,我想请教一下(仅供参考):ClickHouse如今已发展成为堪称全球标准的产品。如果要列举社区发展过程中最重要的一点,您认为是什么呢?
Alexey:关键在于始终对社区保持开放态度,并维持参与者的积极性。例如,我们的代码库会收到来自世界各地的拉取请求,但在审查时,有时会发现它们未达到质量标准。如果是普通的开源项目,或许只会直接拒绝或要求修改。但我们认为,每位贡献者都有成长的潜力。我们要激发他们的积极性,积极提供帮助,让他们真切感受到自己是项目的一员。这样一来,他们就会成为我们的拥趸,并向周围的人推广这个项目。
这段历程绝非一帆风顺。在社区初创时期,曾有一段时间只有极少数的热心人士参与其中。在那段时间里,我们必须持续为他们提供积极的反馈和激励。
金筑:正是这种热忱的互动,才让我们对ClickHouse及其社区建立了信任。当然,作为一款产品,其卓越性自不必说,但我们选择ClickHouse的另一个原因就在于其社区。例如,ClickHouse的日本成员积极地为我们提供了支持,不仅赠送了免费积分,还给了我们机会在ClickHouse社区活动中分享见解。如果有任何问题,他们通常都会在1小时内迅速回复。正因如此,我们才信任ClickHouse。这种可靠性对企业而言至关重要,对于初创企业来说更是关乎生死存亡的问题。
我们SIGQ虽然形式不同,但也高度重视赢得客户信任的相关举措。例如,获得SOC2 Type 1认证,以及作为研究人员在国际会议上发表论文,都是其中的例证。
虽然大家都知道丰田这样的大企业,但没人知道那些小型初创公司。正因如此,与客户建立牢固的关系对于业务的增长至关重要。我坚信,不仅技术本身,更是在技术背后的人和社区,共同构成了人们对初创公司的信任。
为了打造最出色的业务和产品
Q. 最后,请两位向读者说几句话。
Alexey:在当前的AI编程中,仍然需要频繁做出决策,目前仍停留在工程师将AI作为工具使用的阶段。然而,几年后,当模型进一步演进,能够将大部分代码编写和决策自动化时,究竟会剩下什么?我认为是产品愿景和产品战略。迄今为止,企业的竞争优势在于“更高效的工作能力”。因此,也有人持悲观观点认为,一旦进入将工作外包给AI的时代,能够承担AI使用成本的资本规模将直接决定竞争优势。但若从更乐观的角度来看,人类应当能够发现值得自主探索的方向,并制定出独具特色的产品战略与愿景。
技术创新永无止境。我们总能找到尝试新事物的机会。关键在于探索各种可能性。即便是现有的领域或竞争激烈的领域,也仍有优化和提升质量的空间。开发出最优秀的产品依然是可能的,这也将为未来的客户创造价值。
金筑:在将AI与数据相结合并加以利用已成为常态的今天,数据时效性的重要性日益凸显。特别是在使用RAG时,数据时效性更是关乎成败的关键。正因如此,我认为ClickHouse是构建RAG的最佳数据库。
我再强调一遍。基于过去10年来无论OLAP还是OLTP,我都对众多数据库进行了深度使用的经验,现在的我毫不犹豫地回答:“ClickHouse是最好的数据库”。正因如此,我希望进一步活用ClickHouse,不仅向日本企业,更希望向全球企业分享其价值,并推动ClickHouse的采用。
Alexey:听到这话,我真的很高兴。毕竟,我们正是为了听到这样的话才努力工作的。
Q. 今天感谢您在百忙之中抽空接受采访!
AI时代的SRE正从“数据解读者”转型为“决策设计者”
随着Agentic Analytics和AI-SRE的出现,为查明原因而进行的调查、总结以及假设验证等工作,今后将迅速提高效率。另一方面,涉及责任的决策、客户应对以及产品战略等领域,仍将由人类负责。即使AI提出了假设,这些领域最终仍应由人类承担责任。
SIGQ和ClickHouse将通过其基础产品和服务,继续致力于将人工智能的力量应用于人类的决策过程。
实用文章一览



