VilaVPNVilaVPN
自主智能体 · 自愈闭环运维

自愈闭环工程

VilaVPN 如何用一套会自主决策的 AI 智能体,
在你察觉之前发现、隔离并修复网络故障。

我们 / 健康 审查 / 故障 未知 已恢复
向下滚动
核 心

一个不需要叫醒任何人,
就自己合上的闭环

故障发生时,一个优秀的值班工程师会在脑子里跑一整套流程:发现、核实、先止血、再根治、确认、恢复。Infra-Sentinel 把这套流程交给机器,不间断地跑下去。

实线 · 感知(发现 / 验证)——今日已上线,跑在「只观察」的影子模式里。
虚线 · 干预(护住 / 修复 / 恢复)——正在逐级开启,每一步都藏在默认关闭的开关后面。

当一个节点被确认是真的挂了,它的第一个动作不是开工单,而是先把坏掉的通路屏蔽掉——客户端无感切到健康节点,坏节点仿佛从未存在。之后才去根治,直到通路被重新验证健康,才解除屏蔽。

发现 验证 护住 修复 验证 恢复。
一个自我修复的闭环,无需任何人被呼叫,就自己合上了。
信 任

先说每一位用户最该问的那件事:
它从不看你

它只针对一件事运作——基础设施的健康状况。某个节点活着吗?某条通路被封了吗?某条线路拥塞了吗?它问的只有这些。

基础设施健康信号 节点活着吗? 通路被封了吗? 线路拥塞了吗? Infra- Sentinel 绝不越过 你的数据 你是谁 你在做什么 你的流量内容

「我们造的是一套修网络、却从不看使用网络的人的系统。」

它不会查看、触碰、解密或记录任何用户流量。推理核心做判断时,喂给它的只有结构化的基础设施证据——连通性结果、错误特征、机器健康——除此之外什么都没有。我们的「无日志」立场丝毫没有改变。

判 断

它拒绝相信单一信号

每一个「故障」结论都必须挣来:连闯几道相互独立的关卡——任何一道,都不足以单独给一个节点定罪。

关卡 1本地连通
关卡 2真实握手
关卡 3外部印证
结论是否定罪
按下方按钮,投递一个信号试试 👇

除了「通」和「不通」,它还有第三种回答

多重关卡一致确认可达。节点健康,正常调度。
不触发告警
不通
独立证据相互印证:对真正要紧的人不可达。启动止血。
触发告警
未知
测量本身出了问题(探测超时、观测点掉线、脚本报错),而不是网络。
绝不当成故障

这个区分听起来很学术,实际上它是分水岭:一套系统在自己「视力模糊」时依然保持冷静,和另一套系统慌乱地去「修」那些根本没坏的东西,差别就在这里。根本原则:观测者自己的故障,绝不能被当成网络的故障。

克 制

它先建立信心,再动手

哪怕关卡都通过了,它也不会凭单次坏读数就动手。一起事件必须在连续多个周期里持续确认,才会被当真——会自我纠正的短暂抖动,就这样被吸收掉。

观测中…
红 = 持续确认累积 · 琥珀 = 被吸收的短暂抖动
安 全

如何「安全地」打造一套如此自主的系统

一套能自动改动基础设施的 AI 威力很大,掉以轻心也会是一台以机器速度搞垮自己网络的完美机器。所以我们对安全的认真,不亚于对能力本身。

🎚️

一级级挣取信任

今天它跑在纯粹的「只观察」影子模式里——探测真实网络、得出真实结论,但在物理上无法改动任何东西。能触碰生产环境的能力都默认关闭,逐级开启。

感知 / 告警
屏蔽故障通路
自主修复

影子模式评估至今:零误报。

🛟

向安全一侧倒

任何模棱两可的情形,都会倒向「什么都不做」。不确定就按住,绝不擅自升级成动作——「未知」永远不会自己变成一次操作。

⚔️

经过对抗式审查的锤炼

多轮由另一个 AI 专门「找茬」的对抗式代码审查,每轮问题都修掉再复查,直到干干净净;背后还有数以百计的自动化测试。

发现 16 → 修复 → …
💓

始终有人在环内

它把「看到了什么、做了什么」实时讲给团队;自己也被一个独立的失联告警盯着——万一它哪天不出声了,另一套系统会拉响警报。

看守者,也有人看守。

底 气

为什么这需要一家像我们这样搭建的公司

只有当你拥有整条通路时,这一切才成立——而市场上大多数玩家并不拥有。一个租别人服务器的转卖者,压根没有可供推理的东西。

Infra-Sentinel跨层推理 · 只看基础设施,绝不看用户
路由 / 调度Routing
中转线路Relay lines
出口节点Exit nodes

我们端到端地拥有整条交付通路,它才能跨越这一切去推理——看见的是基础设施,而永远不是上面的用户。

运营在被审查的最前沿

连接在主动封锁下会以怎样的方式失效——这是靠真金白银换来的、非常具体的知识,如今已内化进系统。

以前沿 AI 为核心

外面再裹上一层确定性的安全护栏。这是几年前根本造不出来的新能力。

于 你

这对你意味着什么

理想情况下,你永远不会「看见」Infra-Sentinel——这恰恰就是它的意义。想象某个夜里,一次故障打垮了一个热门出口:

别家的用户

有人也连不上吗?😭
我这边全崩了…
又挂了?什么时候修好
是不是被墙了啊

在你察觉之前,流量已被绕开故障通路。

连接正常 · 照常在用

同一场故障,两种体验。让连接在你真正需要的那一刻,就是通的。你只管连上,剩下的交给我们。

旧 世 界

我们替换掉的那套:
一次 ping,远远不够

传统做法叫「监控」:一个脚本每分钟 ping 一下每台服务器,谁不回应就呼叫一个人。同一台服务器,从不同位置去看,会得到相反的真相

从一个友好的机房
🖥️
连通 ✓
「服务器活着」——可对真正依赖它的人来说,早已不可用。
从被封锁的网络内部
🖥️
被封锁 ✗
被悄无声息地「黑洞」掉:数据被默默丢弃,连一个报错都没有。
🙈

它非黑即白,而且「睁眼瞎」

ping 只能告诉你机器通不通,却看不见「机器活着、但被封了」。而后者,才是真正影响用户的故障。

它要等一个人

再完美的告警,在它叫醒的那个人还在睡觉时,也是没用的。那几分钟,就是用户被挡在门外的几分钟。

于是我们没有去做「一个更好的告警」,
而是把会推理、会自愈的闭环,放到了那个位置上。