设备告警统一收件箱
多台设备开始邮件轰炸时,自动归并成少量事故线程,还能直接回复邮件处理。
家庭实验室和小团队往往已经有设备会发告警邮件,却没有精力搭一整套监控栈。磁盘满、网络断开或备份失败时,十几台机器可能在几分钟内塞满收件箱。用户只需为每台设备设置一个专属收件地址,原有的邮件告警格式无需改动。
产品从主题、正文特征和到达时间中识别相似异常,把同一轮断网或证书过期归到一个事故线程。网页上显示受影响设备、第一封告警、最新状态和相关邮件。用户不必打开后台,也可以直接回复邮件输入“确认”“静默两小时”或“结案”。这些操作会同步回线程历史。
恢复邮件抵达后,事故自动标为已恢复,并补全从首次异常到恢复的时间线。若同一错误再次发生,产品把新邮件接到已有模式旁,方便判断这是偶发故障还是反复出现的问题。每个线程还能转发给协作者,避免多人各自处理同一封告警。
第一版只处理邮件入口和基础归并规则,适合没有 Prometheus 的个人服务与小型设备群。它不试图替代指标采集或自动修机器,而是先把已经存在的告警变成少量可追踪、可回复的事故。
为什么是现在
一条9月6日的 r/selfhosted 帖询问如何汇总多种设备的邮件告警。S1 评论区给出 Pushover、InfluxDB 和 Prometheus 等方案,但发帖者仍缺少低配置的邮件原生事故视图。S1
目标用户
面向管理多台 NAS、UPS、路由器、KVM 或小服务器的人。故障发生后,多种设备会连续发送格式各异的邮件。此时用户只想确认影响范围,并阻止收件箱继续刷屏。他们已有告警能力,却没有时间维护 Prometheus、Loki 和 Grafana 等组件。
最小切入点
用 Cloudflare Email Routing 为账户生成专属地址,并把来信交给 Worker 的邮件处理器。S2 保存原始邮件、标准化文本和关键头部,便于重新归并。首版用可解释指纹匹配发件地址、主题词、设备名和时间邻近度。恢复邮件只依据同一设备及已确认的恢复词表配对。回复地址携带不可猜测的线程标识,再解析“确认”“静默两小时”和“结案”。网页只做事故列表、线程详情和错误归并修正,不做指标采集。
以小博大
第一批用户就在 r/selfhosted、Home Assistant 社区和家庭实验室论坛。可发布一个公开的设备邮件格式库,邀请用户提交脱敏样本。每新增一种 UPS、NAS 或 KVM 模板,就产出一篇可搜索的接入页。再提供可自托管的轻量转发器,让不愿直接外发告警邮件的人先试用。
竞品与缝隙
怎么赚钱
按设备数量分档月订阅,并保留可用的免费层。付费档增加历史保留期、协作者和更多专属地址。邮件量可设公平使用上限,避免少数告警风暴拖高收件成本。
反方视角
不同设备的邮件格式差异会持续制造解析维护。错误归并会把无关故障放进同一线程,导致用户漏看真正的新事故。拆得过细又无法减少邮件噪声。恢复邮件可能缺少稳定标识,自动结案容易配错。邮件回复指令还要防伪造、转发和重复投递。若静默命令被误执行,关键告警会被压住。产品还会接触内网主机名和故障详情,存储、脱敏与删除能力必须可信。