如果你去公司里随便抓几个一线员工,问一句:你们最近用的那个 AI 智能体,好用吗?
大概率没人马上回答。但是这些员工已经悄悄给这些 Agent 起了个外号——智障体。
这是当下很多企业的真实现场:PPT 里是智能体重构业务、下一代生产力范式,落地到具体岗位,变成一堆让人哭笑不得的错误回复、乱编事实、关键时刻掉链子。
大家一边被迫拥抱智能体,一边给它们起外号。
在2025北京非凡大赏的圆桌会议上,干脆把真实话摊开来说。主持人是负责易点天下 AI 投资孵化和出海 GTM 的 Intelick CEO 朱鹤,对面坐着几位跟智能体天天打交道的一线实战者:做售前数字员工的语核科技创始人&CEO 翟星吉,从达摩院出来做 AutoAgents.ai 的未来式智能创始人&CEO 杨劲松,2009 年就开始帮制造业出海的宜选科技创始人&CEO 胡欣然,在销售领域深挖 AI 智能体的独到科技创始人&CEO 张文浩,以及站在甲方视角落地 Agent 的分众传媒高级 KA 总监桑卓豪。
他们把这个现实问题摆在桌面上:
为什么在 Demo 里光鲜亮丽的智能体,一进企业就变成了智障体?
我们距离真正信任一个智能体,还有多远?
一线员工口中的智障体,到底是哪儿蠢了?
语核科技的翟星吉,几乎一上来就把刀捅到了最疼的地方——准确率。
他们从 2024 年开始做 Agent 数字员工,定位是售前解决方案专家,服务的都是行业第几的头部客户。很长一段时间,他们对外只说一句话:Agent 的准确率,决定它是员工,还是笑话。
在他们的认知里,Agent 就像你招来的新员工:一个人如果长期只有 60 分,你一定会把他开掉;你期待的是稳定在 90 分以上,偶尔犯错还能被原谅。
很多智能体项目,死在了同一个剧本里:前期方案汇报很惊艳,老板点头,一线员工试用两周,发现答非所问乱编事实,最后项目悄无声息地被封存。
不是因为没人爱创新,而是因为没人愿意把自己的 KPI 交给一个 60 分的数字同事。
更关键的是,这个 60 分,往往不是模型能力本身造成的,而是需求没问清、逻辑没拆透、架构没设计好。
翟星吉把 Agent 项目和传统信息化做了个对比:
以前做系统,调研的是业务流程和数据;
现在做 Agent,还要去拆一个业务专家的脑子:
他怎么判断?遇到例外怎么处理?哪些地方是硬规则,哪些是经验直觉?
这些东西,不存在于任何一份 Excel 或 PPT 里,只存在于一个个说不清但就是知道的瞬间。
如果不把这些隐性知识挖出来,任何再强的模型,最后都会被用成智障体。
所以语核干了一件事:他们不指望从市场上直接招到成熟的 Agent 工程师,而是在内部搭了一套系统化的 Agent 架构培训体系,把新人从零拉到能独立设计 Workflow、上下文管理和 Loop 机制。因为模型已经足够聪明,蠢的是组织没跟上。
真正的关键,不是模型不够强,而是场景不对劲
未来式智能的杨劲松,给智障体这个现象加了一个很有用的维度:时间和场景的匹配度。
他们从达摩院出来做 AutoAgents.ai,一开始就面向全球、做全栈:从底层模型到中间工具链,再到上层业务数据,要把整条链路都打通。也因此,他们跟一批对结果极其严苛的大客户打交道,国家电网、三桶油、大行。
在这些场景里,容不得玩票,交付要同时满足:安全、权限、可控、可追责。
杨劲松的观点很直接:
很多智障体,不是因为模型不行,而是你把它丢在了一个它本来就不擅长的场景里。
比如早期大家疯狂迷恋的 Text-to-SQL,用自然语言查数。在 2023 年,模型的代码生成和语义转换能力还不够强,结果可想而知。但到了 2024 年底,随着推理模型能力上来,在限制条件清晰、表结构可控的前提下,单表 Text-to-SQL 的成功率已经可以逼近可用线,这类场景就变得值得重做。
换句话说,智能体的能力边界,是动态扩展的。
你不能用 2025 年的模型,去证明 2023 年那个项目注定失败;也不能拿 2023 年的失败案例,来否认 2025 年的可能性。
杨劲松给智障体下的定义,其实非常工程师:
如果你让大模型在一个完全开放的任务空间里瞎跑,那它当然会‘智障’;但如果你给它一个收窄过的上下文,让它做判别式任务,或者在清晰边界里执行,它是可以很稳的。
这也是他反复提的一个词:Tech-Market Fit(技术-场景匹配)。
今天谈智能体落地,不再只是Product-Market Fit,而是要先问一句:
在此时此刻的技术水平下,这个场景真的适合用 Agent 吗?
如果答案是否定的,或者需要极高的预算才能跑通,那比起硬上,先等等反而是更负责任的决定。
对一些企业来说,最可怕的不是智障,而是忽高忽低
宜选科技的胡欣然,从一个完全不同的角度切进来。
他们是 2009 年成立的老公司,全网月活 8500 万,帮助中国制造企业出海。
这是一门极其重体力的生意,在全国铺了三十多个办公室,员工一年跑出两百万公里,只为一件事:把客户的生意真正做起来。
在这样的公司里,引入智能体,不是为了讲一个新故事,而是为了改造已经运转十几年的商业逻辑。
所以胡欣然的恐惧点,跟很多AI 原生公司完全不同:
我们不怕它今天笨一点,我们最怕的是它忽然变得太聪明。
如果今天模型能力是1,明天发了个新版本变成10,听上去像是好事,但对这种重流程的企业来说,意味着:所有之前基于1做的 IT 改造、流程优化、人员培训,都可能要推倒重来。
反而是 GPT-4.5 到 GPT-5 之间那种没有预期中那么惊艳的升级,对他们来说是一种好消息。技术开始收敛,意味着可以安心在这个梯度上做长期投入。
这提醒我们,智能体经济有两种时间尺度:
一种是模型厂商的时间:追逐一次次 SOTA 刷榜;
另一种是企业经营的时间:关注的是五年、十年的可持续收益。
在后者的时间里,有时候稳定的 8 分比忽高忽低的 9 到 12 分更有价值。
这也是为什么,很多看似保守的企业,其实并不反对 AI,只是还没看到一种能与自身节奏和风险承受能力真正匹配的落地方式。
多轮对话 = 多轮踩雷:销售智能体的残酷数学
独到科技的张文浩,把智障体的问题拆成了一道简单的概率题。
他们从 2012 年开始做 AI 与营销结合,现在专注在销售领域的智能体:
电话里要像真人一样说话,微信里要像真人一样聊天,还要在合适的时候做出转人工决定。
听上去都是拟人化的问题,但一旦变成多轮对话,难度陡增。
张文浩举了一个很有杀伤力的算式:假设大模型单轮回答的准确率有 95%,听上去已经很厉害了。
可一个简单的销售对话,往往要连续聊十轮甚至更多。
那这十轮里每一句都没出问题的概率是多少?
把 0.95 连乘 10 次,大概只剩下六成不到。
也就是说,哪怕你已经做到了单轮 95% 的准确率,多轮下来,用户仍然很容易遇到一次智障回答。
而人的记忆是有偏差的:做对的九句会被当作理所当然,只要有一句智障,整个体验就被打了折扣。
面对这个现实,独到科技做了两件事:
第一,继续堆单轮准确率,这是基础。
第二,承认幻觉不可完全避免,于是在每一句话后面,加上低成本的质检与纠偏流程。
一旦发现问题,就要么屏蔽输出,要么无缝转人工。
他们的结论是:
AI 销售未来一定是人机结合的形态。
我们替代的不是那些能搞定复杂大客户的大销售,而是大量重复且标准化的触达动作。
这听上去很务实,但恰恰构成了智能体经济的一个重要现实:
不是所有环节都适合交给 Agent,有些环节更适合交给更贵的人。
甲方的现实感:别幻想一个 Agent 包治百病
如果说前面几位还属于生产智能体的人,分众传媒的桑卓豪,则站在了使用智能体的人那一端。
他有两个观察,值得所有准备在企业里推 Agent 的人反复琢磨。
第一,当前落地效果最好的,反而不是对外的 Agent,而是对内的知识型 Agent。
比如会议管理:开会之后,谁来把零散的讨论、决策、行动项,沉淀成一个可持续调用的项目知识库?
这类工作,本身就高度结构化,又没人愿意长期做,很适合交给 Agent。
而直接面向复杂客户、上下文极长的对客 Agent,目前反而不那么稳定。
第二,过度复杂的 Agent 架构,会带来性能过剩与噪音过载。
分众在帮品牌做定位、写广告语时,试过给 Agent 设计非常复杂的 Deep Research 流程:
让它读大量报告、竞品资料、用户调研,一层层汇总输入。
结果发现:走完一整套复杂流程,生成的广告语,人类创意团队和客户都不认。
原因不是模型太笨,而是上下文里掺杂了太多无关噪音。有些是客户随口提的一句顺带,反而被模型当成了核心诉求。
于是他们反向踩了一脚刹车:不再幻想一个 Agent 从用户洞察到媒介策略、再到创意输出一条龙搞定,而是把任务切成小块,让 Agent 在每一步里只做一件事。
这次只帮做用户调研整合,下次只帮整理素材,再下一次只帮检查逻辑链条。
中间用大量的人来接力和把关。
这其实是在告诉我们:现在的模型能力已经足够强,真正的挑战是你有没有勇气承认:它只适合干其中的一小截?
上下文工程:从提示词玄学到信息减肥术
过去一年,大家聊智能体时最爱讲Prompt Engineering(提示词工程)。
但从这场对话来看,一个新词已经悄悄接过了接力棒:Context Engineering(上下文工程)。
桑卓豪给了一个特别形象的比喻:你在电梯里碰到分众 CEO 江南春,有 60 秒时间介绍你品牌的背景、用户、诉求,然后请他当场给一个广告语。
绝大多数人,拿到这个广告语会犹豫。因为 60 秒的上下文根本不够载下问题的复杂度。
很多人以为,只要一句 Prompt 写得足够长、足够玄,Agent 就能理解所有背景。
现实是:你给它的上下文,不是越多越好,而是越对越好。
分众的实践路径大概是这样:
第一阶段,他们尝试把所有可能相关的信息都丢给 Agent,让它自己判断缺什么、补什么。
结果发现,Agent 经常抓错重点,把非核心信息当主线。
第二阶段,他们在原始语料之上,加了一个提炼层。
先用一层逻辑来抽取关键信息,再把这部分作为 Agent 主要调用的上下文。
于是,团队 90% 的时间都花在了上下文工程上,Prompt 反而只占了 10%。
未来式智能在做的是另一种版本的上下文工程:他们把上下文拆成几个功能模块,记忆类的用户偏好与历史记录,工具调用返回的数据,以及通过检索增强拿到的背景知识。
静态的部分做 Prefix Caching(前缀缓存),动态的部分则随着任务推进不断更新。
关键在于:他们为上下文工程专门设计了评测方法,能量化哪种上下文切分方式更有效。
而宜选科技则提供了成本敏感型的视角:在他们的包年模式下,每多调用一次大模型,都是自己掏钱。
所以他们反过来问自己:有哪些东西,完全没必要让大模型干?
凡是知识库里已经有、可以用语义或结构化方式直接命中的,都先走缓存。
最后只把那 10%–20% 真正需要推理的活,留给大模型。
如果说提示词工程更多像是给大模型写任务说明书,那么上下文工程更像是给它做信息减肥 + 营养搭配:减掉多余脂肪,只留下真正支撑决策的那一口菜。
看得准、找得准、做得准:降低幻觉的系统性方法
回到大家最焦虑的问题:幻觉怎么控?
语核科技的总结很简洁,却很扎实——准。
第一,看得准。
输入不准,输出再花哨都没用。在企业场景里,看清问题并不只是 OCR 一下文档这么简单,
还要还原流程图里的逻辑关系、PPT 里的版式信息、表格之间的对照关系,否则 Agent 看到的只是碎片化的信息,自然会乱说。
第二,找得准。
很多人以为 RAG(检索增强生成)的难点在向量数据库,但真正困难的是:问题到底应该被怎样定义?
语核把这部分拆成 Agent Planning 和 Agent RAG:先把专家的思维路径显性化,形成一套通用寻找策略,再让 Agent 按这个策略去定位、组合知识。
新的客户来了,只要把资料扔进去,Agent 就能用专家的思路来检索,而不是用模型的直觉乱翻。
第三,做得准。
哪怕你用了最新的基座模型,直接丢给它一个做销售的任务,它照样会智障。
因为真正厉害的销售,有大量隐性知识:何时该追问,何时该收尾,何时该沉默。
这些往往不存在于任何文档,只存在于那些讲不太清楚,但就是得这么做的场景记忆里。
语核的做法是:通过大量访谈和共创,把这些隐性知识显性化,写成 Workflow,
再用合成数据去微调模型,做成真正可复用的岗位数字员工。
这三件事合在一起,才构成了一套完整的反幻觉体系:
它告诉我们,幻觉不是靠一个超长提示词解决的,而是靠一整套工程与知识方法论一起压低的。
跨越信任奇点:从智障体到可信赖同事
说了这么多,回到开头那个词——信任奇点。所谓信任奇点,不是某一天模型突然变成全知全能,
而是企业内部出现这样一个转折点:大多数员工开始愿意把一部分真实责任,交给智能体去承担。
在这个点之前,智能体是一个玩具:用来做 Demo、写宣传稿、做老板的汇报 PPT。
在这个点之后,它才真的成为组织的一部分:
帮你接电话、回客户、写方案、管知识库,甚至参与 KPI 体系。
从这场对话里,我们大概能看到几条通向信任奇点的路径:
第一,把 Agent 当人来设计,而不是当插件来用。
它需要清晰的岗位职责、考核标准、培训体系和升级路径,
而不是一个万能机器人,什么活都往上堆。
第二,承认人机协作是长期状态,而不是用 AI 把人替换干净。
该转人工的地方,要设计好无缝切换的机制,
不要让用户在最关键的时刻,感受到一种被廉价对待的情绪。
第三,在场景选择上,克制点野心,专注把一两个价值足够高的小场景做深。
哪怕只是一个会议纪要 Agent、一个售前数字员工、一个建站配置助手,
只要真的帮业务抠出了时间和利润,它就比十个花哨的概念更有说服力。
第四,接受技术演进的节奏,给组织一个稳定学习期。
不是每一次模型升级,都值得你推翻已有的流程。
在很多时候,稳稳落地上一代能力,比追最新一代能力但落不下来更划算。
最后要说的是:
智障体这个词,本身就带着一种一线员工的情绪宣泄,它不只是对技术的嘲讽,更是对被折腾感的反抗。
要真正进入智能体经济的时代,我们需要的不只是更强的模型,更需要对人、对组织、对信任成本的耐心理解。
当有一天,员工不再把 Agent 当成老板强推的新玩具,
而是像对待一个靠谱的新人同事那样:愿意教它、监督它、也敢让它单独上阵。
那一刻,所谓的信任奇点,才算真正被跨过去了。
更多对话细节
第一部分:开场与自我介绍
朱鹤:先做一下我的自我介绍。我现在在易点天下负责 AI 的投资孵化和并购,以及 AI 行业的各种公司出海 GTM(Go-to-Market)方案,基本上我是这边的首席专家。
今天的话题,我们要从第一个关键词——智障体开始。大家都在讨论智能体,那我们第一个话题就是智障体。现在的 AI Agent 在 Demo 的时候,大家看起来都是比较完美的,不管它是抽卡的结果,还是故意做了一个假的 Demo,都相对比较完美。但是在实际采用的过程中,不管是我们在小团队中,还是在企业中大范围向部门里推的时候,都会崩,都会遇到各种各样的问题。
咱们今天在座还有混沌的 AI 教练,我们在下面交流时发现,在辅导很多企业的过程中,很多一线员工对智能体的评价是非常差的。所以我们觉得首先围绕智障体这个词来拆解一下:之所以是智障体,到底是因为现在的模型能力不够(比如 GPT-5 仍然不足,要等 GPT-6、GPT-7),还是因为在实施过程中 Agent 的架构不对,或者说是工程师的技术能力不行?到底是哪方面出了问题,才让大家觉得这是智障体而不是智能体?
我们从翟总这边开始依次来聊聊。
第二部分:圆桌讨论——为什么会出现智障体?
翟星吉:好的,感谢朱总,感谢大家。先自我介绍一下,我是语核科技创始人兼 CEO 翟星吉。我们是一家 AI Native 的企业,2023年成立,从2024年开始做 Agent 数字员工的方向。一路探索下来,整个进展还是相对顺利的。我们现在主要做的是 Agent 数字员工,定位是售前解决方案专家。简单讲,这个 Agent 就是通过技术的专业性去做方案、做架构、做设计,帮企业把东西卖给至尊用户。我们核心服务的也是各赛道里中国第几或世界第几的头部大客户。
关于智障体这个问题,我觉得主题改得特别好,跟我们很贴切。我们从去年刚开始做 To B 的 Agent 数字员工时,就发现了一个最大的痛点:Agent 的准确率。
过去一年多我们一直对外输出的一个核心价值观就是:Agent 的准确率很重要。去年在 WAIC 世界人工智能大会的时候,那时我们还没有产品和 Demo,只有一个早期的解决方案,但我们有技术团队。我们在现场加了很多人微信,聊得很好,核心原因是我们只问一个点:你们有没有落地过企业内部的 Agent?如果落地过,最大的痛点是不是准确率不够?是不是业务一用就丢?前期汇报感觉很好,最终老板觉得效果不行,就不愿意推新的项目了?
这个点非常打动大家,也成了我们做 Agent 的基石。所以从去年到今年年中,我们很大一部分工作都致力于解决怎么把 Agent 端到端的准确率提到足够高。
因为我们有个基础认知:Agent 数字员工和你招一个真人员工一样。如果你招个人,做事只有60分,这人就会被开除;你得要求他做到90分。而做到90分有很多难点,我觉得最大的难点不在模型,而在需求分析和设计。
需求分析: Agent 项目跟传统的数字化项目差异很大。传统数字化是调研业务流程和数据,而在 Agent 里,除了这些,还要跟人类业务专家聊,去挖掘他的思维逻辑、Know-how、SOP,以及他在不同场景下的反应思路,尝试把这些变成数据和模型。
架构设计: 即便了解了需求,你还得有能力设计 Agent 架构。我们早期交付的项目也踩过坑,准确率不够高。核心还是团队进行 Agent 架构设计的能力不够强——真正能把 Agent 做好,知道各个模型的能力边界,能做好上下文管理、Workflow(工作流)串联、Loop(循环)设计的人才很少。
所以我们在公司内部搭建了一套完整的 Agent 架构能力培训体系。我们不寄希望于从市面上招有经验的人,因为我们发现那种号称两年经验的人能力很有限,而我们自己的优秀员工经过两三个月的内部培训,反而能快速习得这个能力。
朱鹤:所以您这边的结论是:其实模型能力暂时是够的,更重要的是要了解需求,把架构做好,把员工的培养体系建立起来。感谢,请第二位杨总。
杨劲松:好,先自我介绍一下,我叫杨劲松,是未来式智能(Weilaishi)的创始人。我们项目的英文名叫 AutoAgents.ai,成立于2023年6月。从名字可以看出,我们成立第一天就是面向全球提供整体产品和服务的。我们的背景是阿里巴巴达摩院通义实验室出来的三位联创,路线更偏技术全栈一点——从底层模型到中间的 Agent 工具链,再到上层的业务和数据,都要做非常好的整合,来提升 Agent 最终交付的结果。
回到智障体这个问题,我认为最主要的问题在于:需求场景是否是智能体擅长的事情。
在2023年大模型刚出来时,很多公司理想化地想做 Text-to-SQL(自然语言转SQL),用自然语言做查数和分析。但在那个时间点,大模型生成代码和语义转化的能力相对较弱,做出来的智能体效果就差。但到了去年底,随着推理模型和能力的提升,大模型逐步解锁了新场景。
为什么有些场景下智能体会变成智障?因为我们对它期待过高了,希望它什么都能干。要想落地,核心是场景和技术的匹配度(Tech-Market Fit)。
我们现在服务的客户都是非常严肃的大客户,像国家电网、三桶油、大型银行等。他们对交付结果的要求是最严苛的,无论安全性还是权限控制。但现在应用得都还可以,原因就是我们判断了:想做的这个业务场景,在现有的技术阶段是否能很好地满足。
举个例子,如果你现在让大模型去做一个完全开放的任务,它肯定是智障。但如果你给它上下文,让它做判别式任务——比如给一个规则和判断要求,让它基于此做分析,它能做得非常好。再比如现在的代码生成能力上来了,单表的 Text-to-SQL 成功率已经在 99.9% 以上,那今年这个场景就可以做了。
所以,想把智能体变成高准确率的可用状态,核心是跟技术匹配。如果短期不匹配,也可以通过构建特定环境、强化学习等技术手段在特定领域提升效果,当然这取决于客户的预算。
朱鹤:明白,您的回答给了我很大启发。相当于您引入了一个动态的时间维度:Agent 的能力边界是不断扩展的,要符合当下的阶段(比如 GPT-5 的能力)。其次,如果能力不足,可能是前道工序没做好,Context(上下文)准备得不充分。我现在很为后面三位嘉宾担忧,横向的和纵向的时间维度都讲完了,他们后面讲什么?有请第三位胡总。
胡欣然:我是宜选科技的胡欣然。我们公司相对很多 AI 公司来讲是一个高龄公司,大概是2009年成立的。我们做的事情比较传统,就是帮助中国制造企业出海。我们全网月活大概是 8500 万 UV 左右。
我们是互联网上的重体力劳动者。怎么讲?我们在全国建了三十来个办公室,一家家客户上门谈生意,这是个特别辛苦的活。我们去年统计过,做售后服务上门的员工跑的路程接近 200 万公里。
前面两位嘉宾是在 AI 领域因 AI 而生的公司,需要探索 AI 在哪些领域有无限可能。而我们公司比较确定,我们是用 AI 来改造自己的业务,升级商业逻辑。
所以在这个课题上,哪怕不太一样,我们不怕智障,我们最怕的是不稳定。
我最怕今天大模型能力是1,发个版本变成了10。那我今天所有的 IT 投入、所有的流程改造全白费了。它知不知道(智不智能)我不关心,我关心的是它稳不稳定。如果它的智商达不到一个稳定的状态,我是很害怕的。
比如 GPT-4.5 到 GPT-5,你会发现变化没有大家预期的那么高。对于探索型公司来说压力比较大;但对于我们这类公司来说,那是可以接受的——说明这个事情已经稳定了,我是不是可以及时去做很多优化公司商业逻辑的事情了?我最怕不稳定。
朱鹤:现在的嘉宾越来越厉害,开始挑战问题的支点了。后面两位嘉宾很期待。第四位张总。
张文浩:大家好,我叫张文浩,来自独到科技。胡总提到宜选是老牌公司,其实我们成立也很早,2012年就成立了。当时我还在清华读博,主要做 AI 研究,一直研究 AI 如何跟营销结合。独到科技现在主要做销售领域的智能体。
在销售领域,我们比较注重几个方面:
拟人化: 在语音或电话沟通中越来越像人。最近 TTS(语音合成)的效果越来越好。在中国销售主要靠电话和微信,我们关注如何在微信里更像人,自动化地跟用户沟通。
接口调用能力: 核心是什么时候转人工。这需要准确预测当前阶段是否需要调用外部工具或转接,这块我们用了一些强化学习技术。
关于人工智障的问题,我觉得前面嘉宾说得非常好,落地最重要是选好场景。
我们独到科技对销售的看法是:销售是一个长链条的多轮对话过程。比如简单的销售至少要十轮对话。如果大模型单轮调用的准确率是 95%,大家可以连乘一下,$0.95$ 的 $10$ 次方大概只有 $50\%$ 多。这意味着十轮对话后,仍然大概率会出现智障。
所以我们核心考虑:
提升单轮回复准确率: 像语核翟总提到的,通过底层优化解决模型本身准确率。
质检与纠偏: 大模型无法完全避免幻觉,这是机制决定的。既然幻觉一定会产生,我们如何用低成本的方案对每一句输出结果进行质检?如果出现问题,直接屏蔽或更改结果。
我认为 AI 销售是一个人机结合的过程。AI 很难把一个特别成熟的线下大销售替代掉,但在重复性强的场景(如保险电销、微信销售),AI 是比较适合的。
这也让我们对比 AI 编程。像 Cursor,在 GPT-4 出来之前就有了,当时效果很差,但因为产品化做得好,等 Claude 出了新版本、底层能力增强后,它抓住了时机。这对我们的启示是:要看 TMF (Technology-Market Fit)。如果我们预判某个技术现在不成熟,但未来6个月或一年会成熟,这个场景仍然值得尝试。等到大模型底层好的那一天,我们的市场机会就来了。
朱鹤:明白,张总补充了关于应用场景,以及在后端加了一道质检和优化。压力来到了最后一棒,桑总。
桑卓豪:首先自我介绍一下,我叫桑卓豪,来自分众传媒。我是负责 KA(大客户)销售的,也是分众 AI 的牵头人,所以背景跟前几位不太一样——我们是属于使用 Agent 的甲方公司。
我们在使用过程中发现,因为面对的客户情境特别复杂,跟传统电销有很大不同,我们的上下文长度远远超过普通电销。
我们在内部落地最好的,反而不是直接对客的 Agent,而是一个会议管理 Agent。开完会后,怎么把知识沉淀成项目知识库,长期赋能后面的谈判和方案制定?作为一个知识助手,它辅助得比较好。
另外,我们研发了很多帮品牌做定位、输出广告语的 Agent。我们发现:当把 Agent 架构搞得特别复杂时,反而是性能过剩的。
所谓性能过剩,就是 Agent 经过 N 轮 Deep Research(深度研究)、汇总上下文后出来的广告语,我们不认,客户更不认。原因是过程中太多 AI 参与,产生的上下文噪音远超我们能控制的范围。
所以我们现在反而把智能体简化,让它在每一轮会议或提案中,只帮我们做当下的小切口任务。我们不企图它一步到位,从用户洞察到媒介分析再到竞品分析全做完——那样做出来的结果是灾难性的,人无法同频。
我们现在是:做用户调研时,把所有东西放在用户调研 Agent 里处理,提取结果,再做下一轮。这中间有非常多的人参与的部分。所以在我们企业场景中,模型能力已经很够了,挑战反而是如何简化上下文。
第三部分:上下文工程 vs 提示词工程
朱鹤:明白,非常具体。这也引出了下一个话题。您刚才提到上下文可能过多、过长。今年以来,上下文工程(Context Engineering)这个词比较火,比如一些机构(如 Anthropic/Menlo 等)也发了视频或论文讨论上下文卸载。过去咱们更多提到的是提示词工程(Prompt Engineering)。
几位觉得在场景中更多采用了哪一个?还是结合使用?大家可以举一些具体例子。
桑卓豪:我们过往三个月其实都在解决上下文工程的问题。大家一开始容易简单地把 Agent 理解为一个 Prompt 加 Chatbot 的形式。
我举个例子:大家可能认识我们 CEO 江南春(江老师)。假设你今天在电梯里碰到江老师,你有一分钟时间介绍品牌,希望他给你出一个牛逼的广告语。大家觉得他出的这个广告语敢不敢用?
调研过很多公司,大部分反馈是不敢用。为什么?因为60秒不足以把所有事情讲清楚,不足以让这个超级大脑了解我的上下文。
所以我们在研究:到底要用哪些上下文,才能让产出结果充分了解背景?
我们当时做了一个 List,让 AI 自动分析哪些有信息缺口并自动补足,把所有信息放在文件池里让它调用。结果发现做得也很不好。因为它调用的东西跟我们想要的方向不太同频——客户可能随口提了一句非重点,但模型把它当成了重点。
所以 2.0 阶段,我们在基础语料之上加了一个提炼层,把这一层的信息作为重点调取内容。我们 90% 的时间可能在做上下文工程,10% 的时间在 Prompt 上。
张文浩:做 AI 销售对上下文要求也很高。因为每次对话都会留下用户行为(购买特征、情绪、历史记录)。
我们要解决两方面问题:
抽取有效数据: 大部分对话数据(闲聊、随机对话)是无效的。我们要从海量数据中精准抽取关键特征。
数据压缩与预测: 随着数据增长,如何压缩数据并基于当前状态预测下一步销售动作?
我们会把一些数据写在 Prompt 里,一些放在 RAG(检索增强生成)里。但在调用成本很高的情况下,我们会基于垂直场景用强化学习,把场景数据训练到模型里,降低调用成本。
朱鹤:明白。那我追问一句,简单说,咱们怎么解决幻觉问题?
张文浩:幻觉无法完全避免。幻觉产生是因为模型对垂直领域内容的密度低。解决手段:
数据层面: 获得高质量数据,覆盖所有 Corner Case(极端情况),就像训练自动驾驶一样。
数据合成: 通过语言生成模拟更多场景数据来训练模型。
转人工: 即使这样做也不能保证 100%,所以核心是找到合适的时间点无缝转人工。
胡欣然:我们应该是提示词用得比上下文多。因为我们解决的是既定业务。
比如做 AI 建站,用户输入我要做一个科技感十足的网站。这只是用户的提示词,你要把它翻译成 AI 听得懂的系统提示词(System Prompt):行业是什么?产品是什么?色调参数是什么?
这需要内部专业人员去调,我们尝试过开放给客户用,结果发现客户会把 AI 折磨崩溃。所以我们更像是以用户为中心,把用户的模糊语言翻译成 AI 的专业语言。
朱鹤:明白。其实在场景中会有很多重复思考。前段时间蚂蚁推出了一个产品,说针对幻觉重新生成的 Token 退费。针对重新生成、重新思考的 Token,您怎么看?是做缓存机制,还是向客户收费?
胡欣然:这由商业模式决定。假如我是按 Token 加成收钱,我肯定让你使劲用。但我们是包年服务(比如一年5万),那我省下的每一分钱都是利润。
所以我们必须做缓存机制(语义缓存、知识库缓存)。明明知识库里有,为什么还要大模型去干?我们大概能控制到让大模型干的活只占 10%-20%,否则钱都是自己掏的。
杨劲松:我们更多是动态的上下文工程。
Prompt 相对固定,而上下文工程是为了解决 Long-tail(长尾)场景。我们需要动态加载几块内容:
记忆类: 用户偏好、历史记录。
工具类: 搜索结果、查天气、查机票等 API 返回的信息。
背景知识: 针对特定任务环节,通过 RAG 补充进来的 ID 或文档。
我们会把上下文切分成几块:固定的部分利用缓存(Prefix Caching);动态的部分根据任务执行产生。这需要建立一套评测方法,判断上下文工程是否有效。
翟星吉:我从我们的视角回答如何控制幻觉,我们总结为三件事:看得准、找得准、做得准。
看得准(Input): 比如我近视不戴眼镜开车很危险。我们要保证 Agent 输入的信息足够准。前期要做大量数据处理,还原复杂的文档、流程图、表格、PPT 的板式布局信息,而不仅仅是 OCR 文字。
找得准(Retrieval):
Agent Planning: 定义问题比找答案难。Agent 要有规划性。
Agent RAG: 岗位专家有自己的方法论。我们预先构建了常见知识的分类处理和检索策略。新客户来了,只要把资料扔进去,Agent 就能按专家的逻辑找信息。
做得准(Execution): 哪怕是像 Gemini/Llama 等最新的基座模型,直接做 Sales Agent 也是智障。因为模型是数据的产物,而专家的隐性知识(Implicit Knowledge)不存在于显性文档中。
我们通过调研、沟通,把专家脑子里的隐性知识显性化,变成 Workflow,变成合成数据,再做微调(Fine-tuning)。只有通过这一整套系统性方法,才有可能降低幻觉。
第四部分:投资游戏(Ending)
朱鹤:非常好,三准印象深刻。最后进入娱乐盘:如果各位是投资人,除了投自己的公司,这几位嘉宾里你们愿意投谁?(桑总除外,他是甲方)。
翟星吉:这个太拉仇恨了……我就投轻松(杨劲松)吧,因为大家都是技术背景出身,观点比较类似。
杨劲松:我觉得投星吉(翟总)还有点不好意思……我可能会投分众的桑总。
因为 Agent 要结合行业场景,分众积累了大量数据,这是战略壁垒。技术领先也就是半年周期,关键看壁垒(数据、口碑)。
朱鹤:他是甲方,不能投。
杨劲松:那我想分一半投给星吉(翟总)。
朱鹤:懂了,不管投谁,你认为场景和数据更重要。胡总?
胡欣然:要是我选,我谁都会投,也可能谁都不投。
因为现在的 AI 都是基于应用在做。门槛有多高,决定了有没有投资价值。目前视野范围内,真正有门槛的 AI 应用并不多。它可能是一个生意,但不一定具备投资价值。
张文浩:我可能会投语核科技的翟总。
因为我们看好 AI 销售这个大方向。除了 AI 编程,AI 销售是最容易落地且市场空间巨大的。我们大方向一致但客户群不一样,这样可以风险对冲。
桑卓豪:我现在的地位比较超然。我更愿意跟翟总和张总多交流一下,一人投一半。因为还是想解决销售垂直场景、怎么把 KA 大客户搞定的问题。
朱鹤:好,音乐在催我了。其实还有很多问题没问完,希望以后有机会向大家交流,谢谢大家!