---
title: "你每天按了多少次 ENTER？一家 AI 公司盯上了这个信号"
id: "20260420A079LM00"
publicationAccount: "非凡产研"
originalPublishedAt: "2026-04-20T18:01:48+08:00"
canonical: "https://ffcap.cn/research/20260420a079lm00"
source: "https://view.inews.qq.com/a/20260420A079LM00"
sourceAccount: "https://news.qq.com/omn/author/21759984"
language: "zh-CN"
tags: ["AI 编程","记忆与上下文","非凡大赏","OpenAI"]
---

# 你每天按了多少次 ENTER？一家 AI 公司盯上了这个信号

文章中的“非凡产研”是原始发布账号署名，不代表已核实个人执笔作者。引用访谈或圆桌观点时，应按正文标明具体发言人及当时身份；无法确认时不要推断。日期为原始发表日期，历史信息以发布时点为准。

**非凡大赏**

## **你每天按了多少次 ENTER？一家 AI 公司盯上了这个信号**

  

真正值得被 AI 理解的，也许不是你说了什么，而是你在哪个瞬间做出了决定

"

每一次 ENTER，都是人类说了“我决定了”的时刻。发送一条消息、确认一个操作、提交一段代码。这是全天工作里信息密度最高的那一帧，也是一个人意图最清晰的瞬间。

你今天按了多少次 ENTER 键？

不知道。没人知道。但有一家产品在认真数这个。

他们的逻辑是：每一次 ENTER，都是人类说了“我决定了”的时刻——发送一条消息、确认一个操作、提交一段代码。这是全天工作里信息密度最高的那一帧，也是一个人意图最清晰的瞬间。

AirJelly 做的，就是在这些瞬间悄悄出现，记住你做了什么，然后在该提醒你的时候，轻轻推你一把。

宋子文（Ziwen）是 AirJelly 的联合创始人。我们聊了大概一个半小时，他说过最让我印象深的一句话不是什么宏大叙事，而是这个：

**“我们的设计同学现在用 AirJelly 去修改 AirJelly 的代码。”**

产品用自己的产品重构自己，听起来像在绕口令，但这恰恰是一家 AI 公司最诚实的证明。

![你每天按了多少次 ENTER？一家 AI 公司盯上了这个信号 · 原文图片 1](https://inews.gtimg.com/om_bt/OwfrMo8CQDg0dqpfTOjDp8gp07CNHj_HlvqV5V36EhaWcAA/1000)

  

## **ChatGPT 很强，但对你的工作一无所知**

先说一个很多人忽略的真相。

今天市面上的 AI 工具，几乎都有一个共同的致命缺陷：**它们不认识你。**

ChatGPT 很强，但每次对话从零开始。Notion AI 只看得到 Notion 里的东西。Cursor 只知道你当前这个代码仓库。

你每天同时推进三五个项目，在 Slack、Figma、邮件、Notion、Terminal 之间来回横跳——没有任何一个 AI 知道你整体在做什么。

Ziwen 把这个现象叫做“上下文散落”。

“你在 Slack 里答应了一件事，在邮件里收到了 deadline 变更，在代码里改了三个文件——这些信息分散在不同工具里，**你的大脑是唯一的粘合剂**。”

但人脑会忘、会遗漏、会在切换间丢失上下文。

这就是 AirJelly 的起点：不是要做一个回答更快的 AI，而是要做一个**记得你昨天在忙什么**的 AI。

  

## **它不是 Copilot，而是一直在的那种搭子**

Copilot 是你叫它才来。Companion 是它一直在。

这两个词的差异，比表面看起来要大得多。

Ziwen 解释：Copilot 假设用户知道什么时候该去问它。但现实里，真正需要帮助的时刻——一个被遗忘的承诺、一个快到期的 deadline、一个被打断后没回来的工作线程——用户往往根本意识不到。

“被动式 AI 有一个致命盲点：**它等你开口。但你忘了的事，你不会开口问。**”

AirJelly 的打法完全相反：它通过屏幕持续感知你在做什么，自己判断什么时候该介入，什么时候该闭嘴。

技术上，它的工作流程大概长这样：  
       定时截屏 → VLM 理解屏幕内容 → 触发记忆提取 → 情景记忆 + 语义记忆 → 与任务库做向量匹配 → LLM 判断是否新建任务

每一帧截屏不是随机的，而是在用户按下 ENTER 的时刻精准触发——那是决策最清晰的瞬间，信息密度最高。

“这样，当你很忙的时候，它截得勤；你发呆的时候，它不截；你每次截的，都是‘已完成一个动作’之后的状态，不是你打字打一半的中间态。”

  

## **主动提醒怎么做到“有用但不烦人”？**

几乎每一个做主动通知的产品，最后都死在同一个问题上：打扰太多。

AirJelly 为了解决这个问题，把提醒系统拆成了四层：

**信号检测 → 信号累积 → 场景匹配 → 推送决策**

不是看到一个信号就推，而是信号要先累积到阈值，再匹配已知场景（比如“承诺未兑现”、“高优任务长时间未推进”），最后还要过一道推送决策：冷却时间、全局频率限制、任务级防重复。

我问 Ziwen，这个边界怎么定的？

他停顿了一秒，然后说：

“**真正有效的主动支持，和瞎提醒之间的边界，是它是否比你更早知道你需要它。** 如果用户已经想起来了，它再来提醒，就是打扰。如果用户还没想起来，它来了，就是价值。”

  

## **Event 是事实，Task 才是理解**

很多人对 AirJelly 的第一个担心是：它会不会抓错？

Ziwen 把这个问题拆得很细。

AirJelly 内部有两个层次的概念：**Event（事件）** 和 **Task（任务）**。

Event 是原始观察：「用户在 Slack 里跟张三讨论了 API 设计方案」。这个一定记，有截屏就有记录。

Task 是目标级抽象：「完成 API 接口重构」。这个只有 LLM 判断这个事件代表了一个可操作的工作目标时，才会被创建。

更关键的是，任务创建不是简单提取关键词。LLM 会做一个“升维”动作：把具体事件抽象成一个能容纳未来更多相关事件的工作目标。

举个例子，你跟人讨论了 API 方案，它不会只记一条 API 方案的备忘，而是理解这是“重构接口”这个任务的一部分，把后续相关的截屏都归进来。

“**它不是在抓关键词，是在读懂语境。**”

  

## **真正可用的记忆，需要满足一个条件**

AI Memory 这个功能，几乎每家大模型都在做。但用过的人都知道，大部分时候感觉不靠谱。

Ziwen 对这件事有自己的判断：**传统搜索是你知道要找什么，AI 记忆要解决的是你不知道该用什么词来找的那种需求。**

“上周跟谁讨论过那个 API 方案来着？”

你其实不记得当时叫什么名字，不知道在哪个工具里，也想不起来具体日期——但 AirJelly 知道。你直接问，它秒回：上周三 Slack，你和李明聊了 API gateway，他建议用 Kong 不是自研。

这就是 Contextual Memory Recall 和传统搜索的本质差别：**它的索引维度是你的工作语境，不是关键词。**

他们把这部分叫做 Full Traceability（全程可追溯），所有记忆都能找到来源——是哪次截屏、哪个时间点提取的。

“可追溯性对于主动型 Agent 特别重要。因为你需要能够验证它没有理解错你。**如果它说了什么但你不知道它从哪来的，信任就断了。**”

  

## **隐私做到什么程度，用户才敢用？**

AirJelly 做的这些事——持续截屏、理解你的工作活动、提取记忆——如果数据不在本地，大多数人根本不会碰。

Ziwen 说他们内部有一个原则：**能力边界必须小于用户信任边界。**

意思是，即使技术上能做更多，但如果超出了用户的心理舒适区，就不做。

所有活动记录、记忆、任务都存在本地（SQLite + LanceDB）。AI 模型调用通过他们自己的 AI Gateway 走，但传给模型的只是当下需要处理的文本片段，不是整份用户数据。不做云端备份记忆，不做跨设备同步记忆——除非用户主动选择。

“因为这些能力会触碰信任红线。**用户不是怕 AI 看到，而是怕 AI 乱说、乱传、乱用。**”

  

## **护城河不在功能里，在你半年的工作记忆里**

我最后问了 Ziwen 一个比较直的问题：大模型能力这么快，创业公司的护城河到底在哪？

他的回答分了两层。

短期：**工程化能力**。VLM 截屏理解、记忆提取、任务归因、主动推送——每个环节做准确可靠，这需要大量打磨，不是大厂随随便便拿个通用模型就能做好的。

长期：**你的工作记忆本身**。

“当 AirJelly 积累了你半年的工作记忆，迁移成本不是功能层面的，是上下文层面的。**你换一个工具，你的工作记忆就没了。**”

大厂做通用平台，创业公司做深度场景。最不该卷的是模型能力，最该守住的是“对用户工作过程的深度理解”。

Ziwen 认为，现在更像“PC 刚有图形界面”的阶段——方向确定了，但交互范式还没定型。AI Companion 应该是悬浮头像？侧边栏？还是无形的后台进程？这都还在探索。

但有一件事他非常确定：

“AI 会从‘你去找它’，变成‘它在你身边’。就像今天每个人桌面上都有浏览器一样，**未来每个人桌面上都会有一个持续运行的 AI Companion**。”

  

## **访谈精选 Q&A**

**Q1：AirJelly 怎么把散落在不同工具里的信号，理解成一个连续的工作流，而不是一堆零散事件？**

**宋子文（AirJelly 联合创始人）：**技术管线是：定时截屏 → VLM 理解屏幕内容 → 触发记忆提取 → 情景记忆 + 语义记忆，然后每个事件还要经过任务关联——通过向量搜索找到候选任务，再用 LLM 判断该归入已有任务还是新建。这样碎片化的屏幕截图就变成了连续的工作流叙事。最难的工程挑战是：VLM 理解的噪声过滤、跨窗口的上下文衔接，以及任务归因的准确率。

**Q2：ENTER 键为什么能成为理解用户意图的关键切口？**

**宋子文：**ENTER 最特殊——它几乎总是代表“完成了一个意图”：发送消息、提交搜索、确认操作、执行代码。通过在这个时刻触发截屏，我们捕获到的不是打字打一半的中间态，而是用户做出决策之后的最终状态。这带来两个不一样的体验：截屏频率跟用户活跃度自适应（你忙的时候截得多，发呆的时候不截）；以及每一帧都包含“已完成动作”的高密度信息。

**Q3：你们最看重的留存指标是什么，怎么判断用户真的“跑起来了”？**

**宋子文：**我们最看重的不是日活，而是**用户在 AirJelly 里问回过去工作的频率**——也就是“找回一条自己忘了的信息”这个动作发生的次数。这件事发生得越多，说明用户对它的记忆越依赖。一旦有人开始问“我上周跟谁讨论了什么”，而不是自己翻Slack、翻邮件——这个产品对他就真的跑起来了。从“新鲜感”变成“离不开”的标志，就是**搜索行为的迁移发生了**。

**Q4：未来多模态、Agent、记忆、端侧、主动性这五个变量，哪个最先变成决定性变量？**

**宋子文：**我认为是记忆。因为它是其他所有能力的基础——没有记忆的 Agent 每次都从零开始，没有记忆的主动性就是瞎猜，没有记忆的多模态就是一次性理解。记忆，才是让 AI 从“强大工具”变成“可信搭子”的那个转折点。

排版版本：非凡产研-A排版（全文原文）

---

原始发布版本：https://view.inews.qq.com/a/20260420A079LM00

本站阅读页：https://ffcap.cn/research/20260420a079lm00
