本地模型夜班队列
把大型本地模型的长任务放进夜间队列,第二天收到带引用、检查点和完成状态的结果包。
电脑内存有限却想跑本地大模型的人,通常不愿在白天守着每秒不到一个词的聊天窗口。用户在睡前把长文分析、代码审阅或资料整理任务拖进夜间队列,附上文件、期望交付格式和最晚完成时间。产品会先估算任务规模,告诉用户这台机器能否在设定时段内完成。
任务启动后,系统把长上下文切成可独立处理的片段,并在每段完成时写入检查点。它记录已读文件、引用位置、中间摘要和生成结果,所以电脑休眠、临时断电或用户要用机器时,任务都能从上一次停下的地方续跑,而不是从头开始。
夜间运行会避开用户设定的安静时段,并持续监测温度、剩余磁盘和电量。机器过热、接近早晨期限或用户开始使用电脑时,队列会暂停低优先级任务,先保存当前进度。早晨打开页面,用户看到的是完成内容、引用出处、耗时和未完成部分,而非一段真假难辨的长输出。
产品先服务离线资料整理和可分段的代码阅读,不承担需要实时对话的任务,也不会趁用户睡着时修改文件或执行命令。它承认本地推理很慢,换来的则是一个可预测、可暂停、能在早晨交付的夜班流程。
为什么是现在
7月31日,WASTE 以“29 GB 内存、0.50 tok/s 运行 Kimi K3”为题进入讨论;截至8月1日抓取时,该帖以136分、57条评论位列第7。S1 这把“模型勉强能跑,任务却慢到不值得守候”变成了眼前的工作流问题。
目标用户
核心用户是已经安装本地模型,却受限于内存和生成速度的开发者、研究者与敏感资料处理者。他们在睡前仍有长文归纳、代码通读或离线资料整理待办。此时机器即将闲置,等待成本最低。用户需要的不是即时回复,而是次日可核验、可续跑的交付物。
最小切入点
先做单机桌面应用,只接收文档分析和代码阅读。任务拆成固定输入片段,并用 SQLite 保存清单、摘要、引用和产物。推理层做适配器,首批接入 Ollama、本地 OpenAI 兼容接口与 WASTE。WASTE 已提供可嵌入的 C 接口和会话保存能力。S1 llama.cpp 的槽位接口可保存、恢复提示缓存。S2 语义进度仍由应用自身保存,不能只依赖缓存。首版只按近期实测速度估算工期,并在用户活动或电量不足时暂停。温度控制若无法稳定读取,就退化为用户设定的功耗档位。
以小博大
第一批用户可从 LocalLLaMA、模型量化项目和低内存运行教程的讨论区获得。发布一个可复现的夜间代码审阅样例,展示断电前后的同一任务续跑。再提供 Ollama 与 llama.cpp 的现成配置,让已有本地模型用户少改环境。传播重点应是早晨结果包和失败恢复,不是模型跑分。
竞品与缝隙
怎么赚钱
按设备一次性买断桌面调度器。基础版管理单机队列与结果包,高级版增加多台设备调度、历史归档和团队模板。模型、算力与存储均由用户自备,避免按生成量收费。
反方视角
分片处理容易丢失跨段关系,最终结论可能互相矛盾。为补足上下文而反复回读,又会吃掉本就紧张的夜间时长。工期估算依赖模型、上下文、磁盘和温度,首次任务很难报准。若系统承诺早晨完成却频繁留下半成品,用户很快会失去信任。保存提示缓存还不够,应用必须独立记录文件版本和引用位置。文件在夜间被改动后,旧检查点可能已不可复用。跨平台休眠、电池与温度控制也会扩大测试面。继续做的前提,是先把单机、只读和可分段任务的恢复链路跑稳。