跳到正文
非凡资本

研究与观点 / UNIQUERESEARCH

你每天按了多少次 ENTER?一家 AI 公司盯上了这个信号

非凡大赏

你每天按了多少次 ENTER?一家 AI 公司盯上了这个信号


真正值得被 AI 理解的,也许不是你说了什么,而是你在哪个瞬间做出了决定

"

每一次 ENTER,都是人类说了“我决定了”的时刻。发送一条消息、确认一个操作、提交一段代码。这是全天工作里信息密度最高的那一帧,也是一个人意图最清晰的瞬间。

你今天按了多少次 ENTER 键?

不知道。没人知道。但有一家产品在认真数这个。

他们的逻辑是:每一次 ENTER,都是人类说了“我决定了”的时刻——发送一条消息、确认一个操作、提交一段代码。这是全天工作里信息密度最高的那一帧,也是一个人意图最清晰的瞬间。

AirJelly 做的,就是在这些瞬间悄悄出现,记住你做了什么,然后在该提醒你的时候,轻轻推你一把。

宋子文(Ziwen)是 AirJelly 的联合创始人。我们聊了大概一个半小时,他说过最让我印象深的一句话不是什么宏大叙事,而是这个:

“我们的设计同学现在用 AirJelly 去修改 AirJelly 的代码。”

产品用自己的产品重构自己,听起来像在绕口令,但这恰恰是一家 AI 公司最诚实的证明。

你每天按了多少次 ENTER?一家 AI 公司盯上了这个信号 · 原文图片 1


ChatGPT 很强,但对你的工作一无所知

先说一个很多人忽略的真相。

今天市面上的 AI 工具,几乎都有一个共同的致命缺陷:它们不认识你。

ChatGPT 很强,但每次对话从零开始。Notion AI 只看得到 Notion 里的东西。Cursor 只知道你当前这个代码仓库。

你每天同时推进三五个项目,在 Slack、Figma、邮件、Notion、Terminal 之间来回横跳——没有任何一个 AI 知道你整体在做什么。

Ziwen 把这个现象叫做“上下文散落”。

“你在 Slack 里答应了一件事,在邮件里收到了 deadline 变更,在代码里改了三个文件——这些信息分散在不同工具里,你的大脑是唯一的粘合剂。”

但人脑会忘、会遗漏、会在切换间丢失上下文。

这就是 AirJelly 的起点:不是要做一个回答更快的 AI,而是要做一个记得你昨天在忙什么的 AI。


它不是 Copilot,而是一直在的那种搭子

Copilot 是你叫它才来。Companion 是它一直在。

这两个词的差异,比表面看起来要大得多。

Ziwen 解释:Copilot 假设用户知道什么时候该去问它。但现实里,真正需要帮助的时刻——一个被遗忘的承诺、一个快到期的 deadline、一个被打断后没回来的工作线程——用户往往根本意识不到。

“被动式 AI 有一个致命盲点:它等你开口。但你忘了的事,你不会开口问。”

AirJelly 的打法完全相反:它通过屏幕持续感知你在做什么,自己判断什么时候该介入,什么时候该闭嘴。

技术上,它的工作流程大概长这样:
       定时截屏 → VLM 理解屏幕内容 → 触发记忆提取 → 情景记忆 + 语义记忆 → 与任务库做向量匹配 → LLM 判断是否新建任务

每一帧截屏不是随机的,而是在用户按下 ENTER 的时刻精准触发——那是决策最清晰的瞬间,信息密度最高。

“这样,当你很忙的时候,它截得勤;你发呆的时候,它不截;你每次截的,都是‘已完成一个动作’之后的状态,不是你打字打一半的中间态。”


主动提醒怎么做到“有用但不烦人”?

几乎每一个做主动通知的产品,最后都死在同一个问题上:打扰太多。

AirJelly 为了解决这个问题,把提醒系统拆成了四层:

信号检测 → 信号累积 → 场景匹配 → 推送决策

不是看到一个信号就推,而是信号要先累积到阈值,再匹配已知场景(比如“承诺未兑现”、“高优任务长时间未推进”),最后还要过一道推送决策:冷却时间、全局频率限制、任务级防重复。

我问 Ziwen,这个边界怎么定的?

他停顿了一秒,然后说:

“真正有效的主动支持,和瞎提醒之间的边界,是它是否比你更早知道你需要它。 如果用户已经想起来了,它再来提醒,就是打扰。如果用户还没想起来,它来了,就是价值。”


Event 是事实,Task 才是理解

很多人对 AirJelly 的第一个担心是:它会不会抓错?

Ziwen 把这个问题拆得很细。

AirJelly 内部有两个层次的概念:Event(事件) 和 Task(任务)。

Event 是原始观察:「用户在 Slack 里跟张三讨论了 API 设计方案」。这个一定记,有截屏就有记录。

Task 是目标级抽象:「完成 API 接口重构」。这个只有 LLM 判断这个事件代表了一个可操作的工作目标时,才会被创建。

更关键的是,任务创建不是简单提取关键词。LLM 会做一个“升维”动作:把具体事件抽象成一个能容纳未来更多相关事件的工作目标。

举个例子,你跟人讨论了 API 方案,它不会只记一条 API 方案的备忘,而是理解这是“重构接口”这个任务的一部分,把后续相关的截屏都归进来。

“它不是在抓关键词,是在读懂语境。”


真正可用的记忆,需要满足一个条件

AI Memory 这个功能,几乎每家大模型都在做。但用过的人都知道,大部分时候感觉不靠谱。

Ziwen 对这件事有自己的判断:传统搜索是你知道要找什么,AI 记忆要解决的是你不知道该用什么词来找的那种需求。

“上周跟谁讨论过那个 API 方案来着?”

你其实不记得当时叫什么名字,不知道在哪个工具里,也想不起来具体日期——但 AirJelly 知道。你直接问,它秒回:上周三 Slack,你和李明聊了 API gateway,他建议用 Kong 不是自研。

这就是 Contextual Memory Recall 和传统搜索的本质差别:它的索引维度是你的工作语境,不是关键词。

他们把这部分叫做 Full Traceability(全程可追溯),所有记忆都能找到来源——是哪次截屏、哪个时间点提取的。

“可追溯性对于主动型 Agent 特别重要。因为你需要能够验证它没有理解错你。如果它说了什么但你不知道它从哪来的,信任就断了。”


隐私做到什么程度,用户才敢用?

AirJelly 做的这些事——持续截屏、理解你的工作活动、提取记忆——如果数据不在本地,大多数人根本不会碰。

Ziwen 说他们内部有一个原则:能力边界必须小于用户信任边界。

意思是,即使技术上能做更多,但如果超出了用户的心理舒适区,就不做。

所有活动记录、记忆、任务都存在本地(SQLite + LanceDB)。AI 模型调用通过他们自己的 AI Gateway 走,但传给模型的只是当下需要处理的文本片段,不是整份用户数据。不做云端备份记忆,不做跨设备同步记忆——除非用户主动选择。

“因为这些能力会触碰信任红线。用户不是怕 AI 看到,而是怕 AI 乱说、乱传、乱用。”


护城河不在功能里,在你半年的工作记忆里

我最后问了 Ziwen 一个比较直的问题:大模型能力这么快,创业公司的护城河到底在哪?

他的回答分了两层。

短期:工程化能力。VLM 截屏理解、记忆提取、任务归因、主动推送——每个环节做准确可靠,这需要大量打磨,不是大厂随随便便拿个通用模型就能做好的。

长期:你的工作记忆本身。

“当 AirJelly 积累了你半年的工作记忆,迁移成本不是功能层面的,是上下文层面的。你换一个工具,你的工作记忆就没了。”

大厂做通用平台,创业公司做深度场景。最不该卷的是模型能力,最该守住的是“对用户工作过程的深度理解”。

Ziwen 认为,现在更像“PC 刚有图形界面”的阶段——方向确定了,但交互范式还没定型。AI Companion 应该是悬浮头像?侧边栏?还是无形的后台进程?这都还在探索。

但有一件事他非常确定:

“AI 会从‘你去找它’,变成‘它在你身边’。就像今天每个人桌面上都有浏览器一样,未来每个人桌面上都会有一个持续运行的 AI Companion。”


访谈精选 Q&A

Q1:AirJelly 怎么把散落在不同工具里的信号,理解成一个连续的工作流,而不是一堆零散事件?

宋子文(AirJelly 联合创始人):技术管线是:定时截屏 → VLM 理解屏幕内容 → 触发记忆提取 → 情景记忆 + 语义记忆,然后每个事件还要经过任务关联——通过向量搜索找到候选任务,再用 LLM 判断该归入已有任务还是新建。这样碎片化的屏幕截图就变成了连续的工作流叙事。最难的工程挑战是:VLM 理解的噪声过滤、跨窗口的上下文衔接,以及任务归因的准确率。

Q2:ENTER 键为什么能成为理解用户意图的关键切口?

宋子文:ENTER 最特殊——它几乎总是代表“完成了一个意图”:发送消息、提交搜索、确认操作、执行代码。通过在这个时刻触发截屏,我们捕获到的不是打字打一半的中间态,而是用户做出决策之后的最终状态。这带来两个不一样的体验:截屏频率跟用户活跃度自适应(你忙的时候截得多,发呆的时候不截);以及每一帧都包含“已完成动作”的高密度信息。

Q3:你们最看重的留存指标是什么,怎么判断用户真的“跑起来了”?

宋子文:我们最看重的不是日活,而是用户在 AirJelly 里问回过去工作的频率——也就是“找回一条自己忘了的信息”这个动作发生的次数。这件事发生得越多,说明用户对它的记忆越依赖。一旦有人开始问“我上周跟谁讨论了什么”,而不是自己翻Slack、翻邮件——这个产品对他就真的跑起来了。从“新鲜感”变成“离不开”的标志,就是搜索行为的迁移发生了。

Q4:未来多模态、Agent、记忆、端侧、主动性这五个变量,哪个最先变成决定性变量?

宋子文:我认为是记忆。因为它是其他所有能力的基础——没有记忆的 Agent 每次都从零开始,没有记忆的主动性就是瞎猜,没有记忆的多模态就是一次性理解。记忆,才是让 AI 从“强大工具”变成“可信搭子”的那个转折点。

排版版本:非凡产研-A排版(全文原文)


来源:非凡产研 · 腾讯新闻。文章中的“非凡产研”是原始发布账号署名,不代表已核实个人执笔作者。引用访谈或圆桌观点时,应按正文标明具体发言人及当时身份;无法确认时不要推断。日期为原始发表日期,历史信息以发布时点为准。

阅读原始发布版本 ↗
← 返回研究文章库