点了一整天「同意」,AI还是被你自己卡住了
一场圆桌,四位实战派,关于Agent权力与责任的硬核交锋
"市面上大部分所谓的AI落地,本质上都是公关层面的包装和噱头。"
这句话是Matthias Hendrichs说的。前Apple App Store商业运营负责人、现Pit亚太区董事总经理,在新加坡AI Agent峰会的一场圆桌上,说话不留情面。
AI到底帮大企业省了多少钱?答案是几乎还没有,数得过来。接着他补了一句更狠的:那些全球科技巨头的裁员潮,和AI没有半毛钱关系,大多数企业根本没在核心业务里真正部署过AI。
这是新加坡AI Agent峰会里一场圆桌的讨论内容。苏晋毅,AIDX增长负责人,十年产品经验加上五年金融治理和审计背景,聊的是合规。王启亨,LingoAI联合创始人,和万维网之父Tim Berners-Lee一起做去中心化AI,聊的是数据主权。Kisson Lin,SuperIntelligence CEO,前Meta和TikTok出身,专注AI记忆四年,聊的是长周期Agent的边界。再加上Matthias,从Apple出来的实战派。
四个人,四条完全不同的赛道,但聊到最后撞上了同一个问题。
表面上,这场圆桌讨论的是技术——Agent能做什么、不能做什么,安全红线在哪,治理框架怎么搭。但听着听着你会发现,真正让人坐立不安的,不是技术够不够强。
谁控制这个智能体?谁为它的错误买单?谁享受它创造的收益?
当你说「人类在环」的时候,在环里的那个人,真的是你吗?
它已经能干到什么程度
先搞清楚现状,再聊边界。
Kisson说他们内部用编码智能体「一两个小时搭一个网站」已经是家常便饭——你告诉它公司是做什么的,它自己写方案、搭页面、调排版、发布上线。一个完全不会写代码的人,一顿午饭的时间,就能干完过去需要一个前端团队加产品经理两天的活。
但这只是短跑。他们给外部客户交付的是更长线的活——智能体持续几个月运营社交账号、调优SEO策略,搜索算法漂移了自己调整;KOL营销这种需要来回沟通、长线跟进的琐碎工作,过去专人盯梢,现在一个智能体持续盯着,自己调整方向。
它不仅能做事,还能坚持,能在漫长的周期里自己纠偏。
Matthias的视角更像个企业外科医生。Pit专门找那些「坏掉的」、极度依赖纯手工的流程——很多大公司内部还跑着Excel和邮件链条拼出来的古董流程。他的原话:「派智能体过去,无情地自动化掉。」但他同时强调,企业级应用需要的是严谨软件,不是派对上的花活。
能力已经在快速沦陷。但边界在哪?
Kisson给出了一个判断:创造力和审美不算永久壁垒,AI可以学,Fable和Lovable在这方面已经超过人类平均线了。90%以上的纯执行工作最终会被接管,只是时间问题。
真正的分水岭是判断力。编码智能体和研究智能体表现最好,是因为有清晰的评估标准,AI可以自己判断对不对。但商业任务呢?用户运营和产品经理各拿一套相反的数据来找你,该听谁的?这类问题没有标准答案,AI也无从判断。
信任、连接、责任这三件事则长期归人类。AI可以替你起草合同,但客户最终认的是你这个人。出了问题要找责任人,AI不能替人坐牢。
Matthias的逻辑更直接。问题不是「AI够不够强」,而是「这件事可不可逆」。写错文案删掉重来,代码跑崩了回滚一下,可逆的流程大胆让AI上。但产品定价一旦发布、用户协议一旦签署,收不回来,这种节点必须有人把关。
最火药味十足的那段
Matthias率先开炮。
「各位用Claude Code或者其他智能体编程工具的时候,爽不爽?」他环视全场,「但有没有一件事让你极其抓狂——每次智能体想执行一个小动作,就弹出一个需要你点击同意的审批按钮。」
"那根频繁需要人类去点击的手指,成了整个流程中最大的绊脚石和效率减速器。智能体频繁回头请示,不是能力做不到,是安全偏好和组织防线把它卡住了。"
完全可以像Claude Code里那样输入Override,让它直接全速往前跑。说到底,这不是AI能不能跑完的问题,而是你自己的主观判断和偏好选择是什么。
话音刚落,苏晋毅接过了话筒。
「我必须站在相反的意识形态上,泼一盆冷水。」他的声音不高,但每个字都很稳,「'人类在环'本质上是一个不可免除的合规复选框。各国监管机构、安全红线、行业指南都在明文规定:AI模型要推向市场,就必须嵌入人类在环的机制。」
他看向Matthias:「那个按钮不是技术问题,是法律问题。点了同意,责任才转移。跳过它?出了事你个人去跟监管解释。」
合规的现实墙,就这样横在了效率面前。
眼看两人僵持,Kisson插了进来。「两位分歧不在一个维度。让我聊聊哪些底线无论如何不会交给智能体。」
边缘用例的审批,好比王牌销售面对突破底线的大单,也必须敲开销售总监的门,智能体无权自行突破护栏。冲突性决策,产品、工程、运营团队抛出完全对立的建议时该听谁,公司DNA决定答案,智能体学不了这个。高风险场景,公关危机爆发时你不可能放手让智能体随意回应,等它把公司搞破产了再坐在废墟上后悔。使命关键型任务,涉及法务财务税务,专业人员必须交叉复核、签上名字。
"无论智能体如何进化,人类专家在环将永远不可或缺。问题不是'要不要人',而是'人要站在哪一层'。"
Kisson的框架刚搭好,王启亨从角落传来声音。
「我想问一个更底层的问题,你确定在环里的,真的是你吗?」
"所谓的人在环中,很可能是平台幕后的某些人在操控那个环。这正是当前中心化AI最危险的死穴——智能体全在云端,脱离你个人的物理控制。你无法掌控它,却要为它闯的祸和产生的法律后果买单。"
苏晋毅打破了僵局。「Henry的问题刺痛了现状,但我想提供一个务实的出口。如果一个任务有200个子动作,没有人有精力逐一点击确认。所以要换思维,从'人类在环中'升级到'人类在环上'。」
把防线内嵌为智能体的安全护栏,让它内部自己做合规审计,只在触发高级别红线时才惊动人类。「网络安全永远是道高一尺魔高一丈,」苏晋毅承认,「但这个框架至少给了企业一个起点。」
五个人,五把椅子,五种截然不同的人机权力观。争议没有终点,但一个共识浮现:人类不会离开驾驶舱,但座椅的位置正在被重新定义。
真要出了事,算谁的
这个问题比「能力够不够」更扎手。
智能体越来越是你的数字分身,替你签合同、替你转账、替你对外发声,法律责任落在你头上。但你无法掌控它,却要为它的后果买单。
王启亨的答案很决绝:不怪你,怪架构。中心化AI就像一个无比诱人的核心靶子,里面堆满了全人类最敏感的隐私。他和蒂姆·伯纳斯-李正在推进去中心化数据存储协议Solid,让每个人的数据存在自己本地,而不是倒进别人的仓库。他声称这才是Web 3.0本来的定义,AI原生的,跟区块链炒币那套没关系。
苏晋毅没有反驳,只回了一句:「愿景归愿景,工程归工程。」
他的路子完全是另一条铁轨。先给智能体清晰地画出行为边界,在这个参数矩阵里对模型进行饱和压力测试,验证极端情况下会不会偏离轨道。他叫这个「Assurance by Design」,安全合规不能事后补救,必须在设计阶段就埋进去。
两条路并行向前。一条指向底层协议的重构,一条指向工程护栏的加固。哪条更对?我选不出来。一条太慢,一条可能不够。最终答案藏在你对「根本改变」的定义里。
一年后,Agent会在哪个场景成为社会默认的标配?
苏晋毅说,智能体的安全与合规是明年的绝对分水岭,「在安全和隐私上只要犯下任何一个微小的错误,代价都将是直接输掉整场牌局。」字字都像判词。
王启亨的回答像科幻预告片。「5到10年内,人类靠出卖体力换取薪酬的时代将彻底终结。这一年,火速夺回属于你个人的数据所有权,将成为你未来获取被动收入的唯一救命稻草。」宏大、紧迫,带着焦灼。
Kisson最冷静。他说今年无数企业为证明「AI原生」挥霍数百万、盲目裁员,很快就会撞上能力天花板,被迫回头重组人机协作架构。「Agent的ROI真实性审计和企业级治理,将成为明年最核心的爆发话题。」末了丢一句:「一定要选的话,我偏向理性乐观。」
Matthias最犀利。媒体炒着万亿美元的超级AI巨头,但AI到底帮大企业省了多少钱?屈指可数。「想立得住的万亿级AI公司,必须在商业大盘上看到实打实的ROI。接下来一年,把企业里最manual的低效流程找出来,派智能体无情地自动化掉。从低垂果实开始,不出12个月,商业世界会看到排山倒海般的生产力冲击。」
四种声音,四个世界。守闸门的,画蓝图的,算细账的,拆烂摊子的。
真正决定AI Agent命运的,不是技术能走多远,而是人类选择把控制权交给谁。
更多对话细节
Panelist:Soh Chin Yih / 苏晋毅(AIDX Head of Growth);Henry Wang / 王启亨(LingoAI Co-Founder);Kisson Lin(SuperIntelligence CEO);Matthias Hendrichs(Pit Managing Director APAC)
Host:Chelsea(科技自媒体)
嘉宾自我介绍
Chelsea:本场的主题是"主动智能体的能力、安全与治理"(Proactive Agents Capability, Safety and Governance)。我对这个组合感到超级兴奋,因为台上的几位嘉宾背景非常多元,每个人都有极其独特的视角。我知道大家听了一整天的行业黑话,可能已经有点累了。所以今天我的提问会非常犀利、直接,希望能带给大家一些启发和乐趣。
在正式开始之前,先请大家做个自我介绍。我们从 Chingi(苏晋毅)开始吧。
苏晋毅:大家好,我是 Chingi,目前在 AIDX 负责增长(Growth)。AIDX 的业务主要是为那些在产品中部署了 AI 的企业,提供AI 质量保证(AI Assurance)和 AI 测试服务。我个人有 10 年的产品经验,以及超过 5 年的金融治理与合规保障经验,所以我非常清楚现在市场对于 AI 安全和信任的需求在哪里。
王启亨:大家好,我是王启亨(Henry),LingoAI 的联合创始人。我目前正在研究的是AI 与万维网(World Wide Web)的交叉领域。现在的 AI 之所以能充分发展,是因为它从万维网上收集了大量的数据,但这些数据目前都是中心化的,这实际上非常危险。我们正在做的事情,就是把数据所有权归还给每一个人,让每个人都能拥有自己的智能体和数字分身(Digital Yourself)。稍后我会详细介绍这会如何从根本上改变 AI 智能体以及整个 AI 行业。
Kisson Lin:大家好,我是 Kisson,SuperIntelligence 的创始人兼 CEO。我们是一家非常年轻的公司,专注于构建"长周期智能体"(Long Horizon Agent),并率先在增长(Growth)领域落地。大家都知道,当涉及到去市场(Go-to-Market)和业务增长时,往往包含很多长周期任务。比如 SEO(搜索引擎优化)可能要持续长达六个月,期间策略和效果还会发生漂移。因此,我们核心的两个差异化优势就是:上下文一致性(Context Consistency)和专家在环(Expert-in-the-Loop)。
在创立这家公司之前,我是 Mindverse(产品"心识"的母公司)的联合创始人,也曾担任盛大集团旗下 Tanka(一款带有记忆的商务即时通讯软件)的 CEO。我个人在 AI 记忆(AI Memory)领域已经探索了四年多,在此之前还在 Meta 和 TikTok 工作了几年。谢谢大家。
Matthias Hendrichs:大家好,很高兴见到各位。我是 Matthias,Pit 的亚太区董事总经理。Pit 是一家来自瑞典的全新 AI 初创公司,和 Lovable、Lagora 以及许多其他成功的瑞典 AI 公司一样。我们目前正逐步在亚太地区展开业务,主要做的是企业级 AI 落地应用(Enterprise AI Adoption),去自动化那些目前依然非常繁琐、高度依赖人工的后端业务流程。
在加入 Pit 之前,我在 Apple 工作了许多年,负责亚太区 App Store 的商业运营。再之前,我在几年前还成功创立过一家独角兽企业。
话题一:智能体的具体应用案例
Chelsea:感谢各位的简短介绍。既然我们今天的话题围绕"主动智能体"(Proactive Agents)展开,我想先请大家分享一个你们的智能体目前最典型的、真实的具体使用案例。要不先从 Kisson 开始?
Kisson Lin:没问题。我提两个例子,一个对内,一个对外。
在公司内部,我们高频使用编码智能体(Coding Agents)。现在的模型编排和技能矩阵已经让智能体变得极为好用。比如一个典型案例是:我们只需要告诉智能体"我们公司是做什么的",智能体不仅能直接生成一套增长方案,还能顺便把整个网站搭建出来。不仅如此,它还会生成网站里所有的动效,包括产品截图、动画展示,直接嵌入到网页中,最后通过 Vercel 瞬间发布上线。整个过程只需要一两个小时。当然,中途你可能得给它一两次反馈意见,但如果你对细节质量没有极其苛刻的要求,智能体基本上可以独自完成从头到尾的闭环。
对外部客户而言,正如我刚才提到的,我们正在为客户构建长周期智能体(Long Horizon Agent)。它能够同时进行长周期的增长规划和日常执行。比如让它持续几个月运营你的 Twitter 和 LinkedIn 账号,持续调优你的 SEO 策略,甚至是去跑 KOL 营销等这类需要长线跟进的工作。这些就是我们目前实际使用智能体的方式。
Chelsea:很酷。Henry,请分享一下你们智能体的应用案例。
王启亨:好,我来分享一个我们正在构建的智能体。大家应该都听过 Palantir 吧?Palantir 核心做的是本体论(Ontology),通过它把数据结构化,他们这几年的表现和股价都非常亮眼。但 Palantir 服务的是政府和大型中心化企业。而我们正在为每一个普通人构建"个人本体论"(Personal Ontology)。
本体论(Ontology)有一段很长的历史。20多年前,得益于 HTTP 协议,万维网变得非常流行,但万维网带来的问题是数据被垄断在少数大平台手里。我们的隐私、我们承载着财富的数据,被封锁在巨头的孤岛中。因此,万维网的发明者(蒂姆·伯纳斯-李)一直试图通过语义网(Semantic Web)来让数据重回去中心化。语义网是当前 AI 的基石,但 20 年前它被认为过于复杂、难以落地。可到了今天,AI 和大语言模型可以轻而易举地完成语义网建模和本体论构建。
本体论至关重要,因为它可以帮你梳理和结构化数据,让数据变成"AI 就绪"(AI-ready)的状态。未来,每个人都可以使用我们的 LingoAI 智能体,把你在整个万维网上散落的、被巨头割裂的数据拿回来,用你本地的大语言模型进行处理,构建出属于你自己的"个人本体论"。你可以自己去变现你的数据,而不是被平台白白变现。这将从现在开始,彻底和颠覆性地改变整个 AI 智能体行业。
Chelsea:有意思。Matthias,你们那边的应用案例呢?
Matthias Hendrichs:在 Pit,我们在两个不同的环节深度使用智能体。Pit 提供的是一套端到端的解决方案,我们首先会去评估企业现有的工作流,尤其是那些已经"坏掉的"、极度依赖纯手工的糟糕流程。
第一个应用案例:我们用智能体来帮助我们评估这些目前非常低效的人工作业,把它们绘制出来,并推演、设计出全新的、数字化的、自动化的新型工作流。这是第一步。
第二个应用案例:用来"编写"解决方案。基于第一步的评估,Pit 会为客户开发定制化的软件。特别是在企业级层面,你需要的是高度契合业务、达到企业级水准的严谨软件,你不能只靠"氛围编码"(Vibe Coding)去碰运气。所以,我们用智能体来为客户写代码、构建这些定制化的软件。
这就是我们最主要的两个应用场景。
话题二:智能体的能力边界与瓶颈
Chelsea:非常棒。顺着刚才的讨论,我们很自然地来到了第二个问题——能力的边界(Capability Boundaries)。在你们看来,目前有哪些地方是智能体已经可以实现"完全自动化"的?又有哪些是它目前绝对做不到的?能不能分享一些具体的例子?
Matthias Hendrichs:对我而言,真正有趣的不仅仅是看模型"绝对能力"的高低,而是要看哪些业务流程是"可逆的"(Reversible),哪些是"不可逆的"(Not Reversible)。
因为在理论上,你可以让 AI 做很多事情,这早已不是模型本身能力够不够的问题了,而是限制在哪里?在流程的终点,我到底在哪些地方需要有一个"人类在环"(Human-in-the-loop)来做最后把关?核心问题其实是:哪些事情是我完全放心放手、可以交由智能体全权端到端去执行的?而哪些事情是我在中间必须设置检查点(Checkpoints)的?所以,这最终依然取决于具体的业务场景,以及企业对风险的承受度(Comfort Level),而不仅仅取决于智能体自身的能力。
Chelsea:明白了。Kisson,关于智能体能力的真正瓶颈和边界,你的看法是什么?
Kisson Lin:我觉得可以从五个维度来看:判断力(Judgment)、创造力与审美品味(Creativity and Taste)、信任(Trust)、连接(Connection)以及责任(Responsibility)。这几个点正是目前智能体与人类拉开差距的关键。
在"执行"(Execution)层面,我们看到智能体正在承接越来越多的工作,端到端地跑通复杂的流。这里唯一的瓶颈只是计算机操作(Computer Use)和 API 的打通。随着 MCP、CLI 等技术越来越成熟,模型接入的 API 越来越多,智能体完成这些任务只是个时间问题,无非是多智能体编排和子智能体处理长周期任务的能力调优。未来,90% 甚至更多的纯执行工作都会被智能体接管。
在"创造力与审美"(Creativity or Taste)层面,有人觉得这是瓶颈,但其实智能体是可以习得的。大部分人应该都试过 Fable,这个新模型在审美上表现就相当不错。还有像 Lovable 这样的工具,在"氛围编码"(Vibe Coding)网页时,展现出的品味和创造力也很棒。它不需要超越世界上最顶尖的那些人类天才,只要能超过人类的平均线,它就已经具备极高的实用价值了。
当前的真正分水岭在于"判断力"(Judgment)。这类似于模型的自我评估(Evaluation)。现在主流大模型公司擅长的编码智能体或研究智能体,其核心都在于拥有非常明确的评估标准(Clear Evaluation),所以它们可以自己做判断、跑完闭环。但紧随其后的下一步,是更偏商业导向的任务(比如业务增长、产品路线图制定等)。当用户运营团队和产品经理拿着截然相反的反馈来找你,你该信任谁?这在每家公司里都没有标准答案。这种"判断层"是智能体现阶段无法自动完成的。
不过,随着大家开始为企业构建上下文图谱(Context Graph)——这也是今年最火的热门话题之一,越来越多的公司在做——智能体将通过学习企业过去的决策模式,逐步掌握 consistent 的判断力和决策标准。虽然目前这个层面的工作 80% 到 90% 依然由人类主导,这也是为什么我们需要人类在环(Human in the loop),但迟早这个比例会变成 50/50,甚至由智能体占据主导。
最后是信任、连接和责任。人类将永远拥有"连接"与"责任"。智能体可以帮你写好一份完美的法律合同,但你最终依然需要一位执业律师去签字认证,为结果背书,确认这份合同对公司是否安全。这种高风险、高责任的事情,无论智能体的能力演进到什么地步,都很难完全由智能体去自主承担。
Chelsea:确实,边缘案例的判定始终需要人类的直觉和智慧。Henry,基于你的经验,有哪些事情是你现在会去刻意避免让智能体插手的?随着底层模型能力的不断飙升,你觉得这一边界又在如何演变?
王启亨:我认为智能体必须具备"主权"(Sovereignty)能力。这是最关键的一点,否则大语言模型的能力越强,智能体对每个人来说就越危险。
就拿 OpenClaw、Hermes 或者其他任何智能体来举例。以前,大语言模型完全是"云端 AI"(Cloud AI)。每个人都在把自己的数据喂给云端的 AI。幸运的是,在那个阶段,你依然拥有自己的本地设备,比如你的 PC、手机,里面存放着你的私密数据、邮件和即时消息。但现在,很多人有一种误解,以为像 Hermes 这样的开源模型跑在我的本地设备上,就是完全本地安全的了。于是大家开始毫无防备地把邮件、私人信息、财务数据、商业计划书和机密文件一股脑地喂给这些运行在本地的智能体。
但糟糕的是,尽管这些智能体是在你的本地设备上运行,它们却会把你的私密信息打包、一比特不剩地发送回背后的云端 AI 数据库中。这是最危险的部分。以前通过社交媒体,平台幕后的少数人就可以潜移默化地改变大众的观念;而到了 AI 时代,这种中心化的 AI 会变得更具破坏性,它甚至可以非常轻易地颠覆一个中小国家,在每个人毫无察觉的情况下洗脑和改变你的思维模式。
因此,在这个"智能体 AI"(Agentic AI)时代,最重要的事情是使用"主权智能体"(Sovereignty Agent)和"主权 AI"(Sovereignty AI)来保护你自己和你的国家。这也是 LingoAI 目前正在和万维网的发明者(蒂姆·伯纳斯-李)共同在做的事情,我们要去重塑智能体 AI 的底层基础设施。这是一项极其关键的变革,因为我们需要构建全新的协议来替代老旧的 HTTP。单纯的 HTTP 太过简单,根本无法保护我们每个人。
我们需要基于语义网本体论建立全新的去中心化数据存储协议,叫作Solid,并将其与 LingoAI 平台相结合。这样,每个人都能在本地真正拥有自己的数据、拥有自己的 AI,而且现在的硬件技术已经完全准备好了。
Chelsea:明白,你的观点是我们需要一个更安全的"主权 AI",采用截然不同且更安全的底层架构或技术,去从根本上治理和约束其他的 AI。
王启亨:是的。这里面有一个非常重要的概念,被几乎 99% 的普通大众甚至行业人口误解了,那就是Web 3.0。在座的各位有多少人听过 Web 3.0?(现场很多人举手)。大家普遍认为 Web 3 就是区块链、就是加密货币,这完全是错的。
实际上,我在 2003 年就提出并定义了这个术语,当时我将 AI 与万维网、社交网络进行了结合。随后在 2006 年,万维网之父蒂姆·伯纳斯-李爵士正式将"去中心化"的概念引入了 Web 3.0。所以,Web 3.0 从诞生的第一天起,骨子里就是 AI 原生的(AI Native)。那时候甚至连区块链都还没影子呢。在语义网协议中,本来就包含了密码学和可追责性。现在,我提出了"Web 3.0 的大一统理论":将语义网(Semantic Web)与区块链、加密货币的"价值传递属性"相结合,去置换掉语义网中原本不完美的那部分密码学机制。这一整套全新的协议栈,将全方位地赋能和增强智能体 AI 以及其他所有大语言模型。
Chelsea:非常有意思的观点。那么从安全和合规的视角来看,Chingi,你觉得智能体的能力边界和隐患在哪里?当智能体在帮企业执行任务时,大家最应该提防什么?
苏晋毅:我想站在更高的一两层维度来看待这个问题。对于智能体 AI,现在大家都达成了一个共识:我们毫无疑问会在未来用智能体帮我们处理掉所有的日常工作,这毋庸置疑。
但在安全视角下,真正的隐患在于:"你不知道你不知道的事情"(The things you don't know you don't know)。在设计智能体 AI 或将 AI 引入产品的设计阶段,设计师和开发者往往只能考虑到他们已知的问题和盲区,却对那些未知的盲区一无所知。当产品风风火火推向市场后,智能体一旦在这些未知盲区犯错,就会瞬间引发重大的安全灾难和信任崩塌。
顺便做个小广告,我们公司做 AI 质量保证(AI Assurance),就是为了帮企业去找出这些你们自己未曾察觉的漏洞和鸿沟。在 AI 安全领域,有非常多的维度需要考量:鲁棒性(Robustness)、幻觉(Hallucination)、公平性(Fairness)、隐私(Privacy)等等。但我发现绝大多数人在设计产品时,满脑子想的都是怎么快速推向市场去变现,根本不考虑这些,甚至根本不知道还有这些维度的存在。所以,我认为智能体的安全不能靠事后补救,AI 的安全和合规必须在"设计阶段"就深度介入。过去我们常说"安全源于设计"(Security by Design),如今,我们应该称之为"保障源于设计"(Assurance by Design)。
话题三:人类在环(Human-in-the-Loop)的未来走向
Chelsea:"Assurance by design",这个总结很精准。刚才几位嘉宾都不约而同地提到了"人类在环"(Human-in-the-Loop)和"人类在环外"的讨论。我想就这个话题带大家挖得更深一点。
Kisson,刚才你提到过 20/80 或 50/50 的比例转换。我们看到像 Anthropic 等公司推出的最新模型已经非常惊艳,可以自主跑测试长达 50 分钟甚至两小时。在你看来,底层模型能力的这种狂飙,会如何改变"人类在环"的平衡点?你对未来的预测是怎样的?
Kisson Lin:这是一个非常棒的问题。模型一定会进化到能够完全自主学习、独立完成长达数天任务的阶段,并且它在商用场景下的决策逻辑也会和现实中的人和组织越来越契合、越来越一致。到了那个节点,我们会给予智能体极高的信任度,放权让它们完全自主地处理绝大部分事务。
但在组织管理中,依然有一些铁打的底线,是企业无论如何不会移交给智能体的:
其一是"边缘用例的审批"(Edge Case Approvals)。这就好比即便是最厉害的王牌销售,在面对一个极其特殊、突破底线的客户大单时,他也必须要敲开销售总监的门说:"老大,这个特批你能签字通过吗?"这是出于全公司的安全护栏和核心原则考量。
其二是"冲突性决策"(Conflicting Decisions)。理论上,智能体可以通过上下文图谱把公司的决策风格学得惟妙惟肖,但在真实的人类世界里,组织内部永远充斥着冲突。我们常说每家公司有不同的"公司 DNA"。有的公司是技术文化(Engineering Culture),有的是产品文化(Product Culture)。当产品团队、工程团队和运营团队抛出完全对立的建议时,该听谁的?即便是崇尚技术文化的公司,有时候出于商业考量也必须妥协去优先顺应产品的决策。这里面有极其复杂的利益权衡。甚至推演到极致,人类有时做决策是带有情绪的——而且往往是积极的正面情绪,比如突然涌现的极其狂热的激情,或者一种必须要把某个东西造出来的本能冲动。这种时候,人类必须要拥有能够直接覆盖(Override)智能体冰冷计算的最高权限。
其三是"高风险、命悬一线的场景"(High Stake Responsibilities)。比如公关危机(PR Crisis)。理论上,一个超聪明的智能体完全可以自己去处理、自己去踩坑交学费。但现实中你根本赌不起。当全网公关危机爆发时,你不可能放手让智能体去随意回应,等它搞砸了、把公司搞破产了,才坐在废墟上说:"哦,原来智能体刚才学错了。"这种时候必须有最顶尖的人类专家提供智力支持,由人类来做最终的判断和审批。
最后是长周期规划(Long Horizon Planning)的监督。你不可能丢给智能体一个任务,等三个月后回来,它两手一摊告诉你"对不起搞砸了"。你必须把宏大任务拆解成无数个小里程碑,由人类导师(Supervisor)全程监督进度并给予微调建议。再比如涉及法务、财务和税务这种出一点错就会面临灭顶之灾的"使命关键型"(Mission Critical)任务,必须要由专业的合规律师和注册会计师进行最后的交叉复核(Final Look),签上他们的名字,企业才能真正放心。
所以无论智能体如何进化,人类专家在环(Experts-in-the-loop)将永远不可或缺。
Chelsea:明白了。Matthias,关于这一点你的看法是什么?我记得我们私下聊天时,你曾经提到过一个非常硬核的观点,你说 Pit 的终极目标是让"人类完全脱离工作环"(Human totally out of the loop)。能不能跟现场观众解释一下?还是说我之前理解错你的意思了?
Matthias Hendrichs:哈哈,让我换一个稍微不同的、更性感的视角来聊聊这件事。
我相信在座的大部分朋友应该都在高频使用 Claude Code 或者各类智能体代码工具。当我们在写代码、用智能体群(Agent Swarms)狂飙效率的时候,感觉真的很爽对吧?但是,难道你们从来没有对一件事情感到极其抓狂和厌烦过吗——那就是每次智能体执行一个小动作,屏幕上就会弹出一个"需要你点击同意"的审批按钮!就是这根频繁需要人类去点击的手指,成了整个流程中最大的绊脚石和效率减速器。
这种频繁的停顿检查在各类智能体任务中屡见不鲜。目前在写代码上最普遍,但其他行业也一样。智能体之所以频繁地回过头来向你请示检查,并不是因为它的能力做不到,而是因为我们自己设置的"安全偏好"和组织防线把它给卡住了。
当然,就像在 Claude Code 里一样,我完全可以输入一个指令把它直接强行覆盖掉(Override),对它说:"别废话了,直接全速给我往前跑!"其他业务场景也是同理。所以,这本质上不是 AI 能不能全自动跑完的问题,而是你自己的主观判断和偏好选择是什么。在哪些特定场景、面对什么性质的边缘 case,你希望智能体停下来向你请示?这种权限划分和安全红线,目前依然有待我们去清晰地定义。但这恰恰是决定智能体能否大规模落地的核心关键。
话题四:智能体安全的责任划分
Chelsea:确实如此。接下来我们重点聊聊安全(Safety)。
Henry,你刚才长篇幅地倡导了去中心化 AI 和 Web 3.0 的世界观,即每个人都应该拥有自己的主权智能体。那我想请问,在那种去中心化的场景下,一旦智能体犯了错、造成了损失,究竟应该由谁来承担安全和法律责任?是底层的去中心化基础设施提供商?是模型生产商?还是每一个拥有智能体的个体自己?请用最通俗易懂、最接地气的语言跟大家解释一下,因为现场很多朋友可能对复杂的 Web 3 基础设施没有概念。
王启亨:很简单,智能体是代表你个人在外界进行各种行为的数字分身。因此,无论在任何时候,最终的法律责任、追责机制以及财务结算的法律主体,都必须是使用者人类自己。
但目前的行业痛点在于,随着 AI 的迅猛发展,"人类在环"正变得名存实亡。所谓的"人在环中",你确定在环里的真的是你吗?很可能是平台幕后的某些人在操控那个环,这正是当前中心化 AI 最危险的死穴。因为大量的智能体目前全都寄生在云端,完全脱离了你个人的物理控制。这意味着,你无法掌控它的行为,但你却必须为它在外面闯的祸和产生的所有法律后果去买单、去坐牢。这太荒谬了,对所有人来说也太沉重了。
所以,我认为对于所有的智能体创业公司乃至整个 AI 行业而言,我们必须在未来五年内,全面且激进地向真正的去中心化 AI 以及混合 AI 架构进行大迁移。这是协议级别的自救,而且我们的留给全人类的时间窗口已经非常窄了。因为中心化 AI 太容易受到攻击了,就在今天,大名鼎鼎的 Fable 5 已经被黑客彻底攻破了。
Chelsea:噢?这个消息我今天还没来得及看。
王启亨:是的,那些由巨头锁在云端的、最强大、最顶尖的大语言模型,就在今天沦陷了。中心化的 AI 就像一个无比诱人的核心靶子,里面堆满了全人类最敏感的隐私、最高密的数据。如果我们不改变底层的网络协议,我们就根本无法实现真正的安全和治理。
我们引入的这套全新协议,能确保每一个人真正把数据的主权捏在自己手里。唯有如此,当你拥有了数据和 AI 的绝对所有权时,你才能顺理成章地参与到未来整个互联网和 AI 时代的财富重新分配中。在不远的将来,通过出让自己真正拥有的数据和 AI 资产,你将获得属于你自己的"被动收入"(Passive Income)和"通用基本收入"(UBI)。
Chelsea:五年内让全球彻底倒向去中心化 AI,不得不说,这是一个非常激进且震撼的行业假设。但商业世界瞬息万变,让我们拭目以待。
Chingi,刚才你也提到过"不知道自己不知道"的理论。那么从网络安全和防线测试的角度来看,我们究竟什么时候才能理直气壮地说,一个智能体已经"足够安全"了?企业需要通过什么样的测试、或者拿出什么样的证据,才能放心地让它上线发布?
苏晋毅:好,我尽量不用那些枯燥晦涩的技术术语,免得把现场的观众听睡着了。
用大白话来说:我们首先必须清晰地界定出这个智能体在特定业务领域内的"行为边界与边界参数"(Domain Parameter)。只有明确了它的活动范围,我们才能在这个参数矩阵里对模型进行疯狂的饱和压力测试,去验证它在什么极端情况下会偏离轨道、会掉链子。
有了这个认知前提,我想回过头来聊聊刚才 Matthias 吐槽的那个"人类在环"的审批按钮。虽然我很理解 Matthias 从效率出发对那个不断弹出的确认按钮感到极度烦躁,但我必须站在相反的意识形态上泼一盆冷水:在目前的商业现实中,"人类在环"(Human-in-the-loop)实质上是一个不可免除的"合规复选框"(Compliance Checkbox)。现在各国的监管机构、安全红线和行业指南都在明文规定——如果你的 AI 模型要开门做生意、要推向市场,你就必须在里面嵌入人类在环的机制。这就是为什么大家都保留着那个按钮,它是个合规红线。
Chelsea:确实,关于"人在环中"有很多种不同的执行和解读方式。如果智能体执行一个任务需要拆解出 200 个子动作,人类怎么可能每一动都去点一下同意呢?这根本不现实。
苏晋毅:对,这正是问题的关键。如果一个任务有 200 个子动作,没有任何人类有精力去全程肉眼复核。
所以,我建议大家在产品设计上换个思维——从"人类在环中"(Human-in-the-loop)升级为"人类在环上"(Human-on-the-loop)。回到产品设计的本源,如果我们已经通过全方位的全光谱安全测试,查明了那些我们原本"不知道的盲区",我们就可以把这些防线和安全原则直接内嵌并锻造成智能体自身的"安全护栏"(Guardrails)或硬编码防线。让智能体在内部自己进行合规审计,只有在真正触发高级别红线时才惊动人类。这才是用产品设计的思维,去优雅地解决智能体安全、同时兼顾商业效率的最优解。
Chelsea:明白,也就是说我们依然是基于已知的问题去构建测试和防线。但网络安全永远是一场没有终点的道高一尺、魔高一丈的攻防战(Attack and Defense)。随着攻击手段的升级,模型也会被逼着变得越来越强。
终局预测:一年后的智能体与潜在隐忧
Chelsea:今天听到了太多极其精彩、甚至交织着火药味的观点。在圆桌论坛进入尾声之际,我想请每位嘉宾用一句话来做个总结和展望:
"在一年左右的时间里,智能体将在哪个场景成为社会默认的标配(Default)?同时,面对来势汹汹的主动智能体(Proactive Agents),你个人最担心、最焦虑的隐忧是什么?"
我们还是先从 Chingi 开始。
苏晋毅:(改用中文交流)我想用一句话向所有正在把 AI 引入业务的企业老板们发出警告:"请记住,智能体的安全与合规是明年的绝对市场分水岭;在企业级智能体的商业游戏里,你在安全和隐私上只要犯下任何一个微小的错误,代价都将是直接输掉整场牌局,被无情淘汰出局。"
Chelsea:一剑封喉。Henry,你的一句话总结。
王启亨:我很赞同刚才 Kisson 提到的 Fable 这个产品,它做得确实比单纯的云端大模型要好。但在当下的节点,安全高过一切。
我想对大家说:"请把智能体真正视作你唯一的数字分身;未来你的'碳基生命'与'数字生命'融合而成的'元生命'(Meta Life),将彻底重构人类的生存状态;在未来的 5 到 10 年内,人类靠出卖体力劳动去换取薪酬的时代将彻底终结,绝大多数人将不再需要传统意义上的工作。因此,在这一年里,去火速夺回属于你个人的数据所有权、智能体所有权和 AI 主权,将成为你未来躺着获取被动收入和通用基本收入(UBI)的唯一救命稻草。"
Chelsea:主权智能体,非常极客的宏大视角。Kisson,你的一句话。
Kisson Lin:我比较关注的是智能体在企业内部的实际投资回报率(ROI)以及组织治理。
今年我们看到无数企业为了证明自己是所谓的"AI 原生公司",疯狂挥霍了数百万美元砸向智能体开发。但这些真金白银真的换来更好的商业回报了吗?很多公司甚至在智能体还没完全跑通前,就急不可耐地开始大规模裁员。我对明年最大的隐忧是——绝大多数企业在心态上要么过于悲观,要么陷入了极其盲目的极度乐观(Too Optimistic)。
他们误以为智能体现在已经无所不能了,烧着宝贵的美元而不是 token 去跑一些伪需求,急匆匆地遣散了员工。但很快,他们就会狠狠地撞上智能体现阶段的能力天花板,发现大批的核心业务智能体根本无法独立完成。到了明年,企业将被迫不得不回过头来,重新去痛苦地摸索和重组全新的人机协作组织架构(Agent-Human Orchestration)。因此,我认为智能体的 ROI 真实性审计以及企业级智能体治理(Company Governance),将成为今年年底到明年最核心的爆发话题。如果一定要在乐观与悲观之间选一队,我个人会稍微偏向理性乐观那一边。
Chelsea:非常清醒且接地气的商业观察。最后,Matthias,请给出你的一句话预测。
Matthias Hendrichs:展望未来,我们现在总是能看到媒体在疯狂炒作那些即将上市、估值动辄冲向万亿美元市值的超级 AI 巨头。但如果我们脱离这些疯狂的宏大叙事,冷静地坐下来问一句:时至今日,AI 到底帮我们在大企业里省了多少钱?帮我们创造了多少真正的商业暴利?答案其实是——屈指可数,几乎还没有。
实际上,我们近期看到的席卷全球的科技巨头裁员潮,本质上和 AI 还没有半毛钱的关系。因为绝大多数传统巨头和企业,到目前为止根本就没有在底层的核心业务里深度部署过任何真正的 AI 智能体。目前市面上的大部分所谓 AI 落地,不好意思我说话比较粗俗,大部分都是公关层面的扯淡和 PR 噱头。
但我坚信,想要诞生真正立得住的万亿美元级 AI 公司,我们必须在商业大盘上看到实打实的 ROI 和经济价值,否则折腾这些干嘛呢?这又不是什么象牙塔里的科技兴趣小组或者高雅的科学实验!我们需要在未来的 12 个月里,脚踏实地地把价值拿回来。
我对未来 12 个月持极其强烈的超级乐观态度(Super Optimistic)。因为这件事情在商业操作上坦白说,一点都不难。我们不需要一上来就大干快上地去用 AI 攻克癌症或者拯救地球,那些伟大的事业可以慢慢来。我们只需要在接下来的一年里,把企业各部门里那些最恶心、最破烂、最 manual 的低效人工作业流程找出来,派智能体过去一个一个地把它们无情地自动化掉。只要从这些最简单、最容易摘到的'低垂果实'(Easy Ones)开始做起,不出 12 个月,整个商业世界就会看到智能体带来的排山倒海般的巨大生产力冲击。这就是我对明年的最大期许。