背景介绍
亚马逊云科技近日联合非凡资本在上海举办了「AI全球化专项加速计划」线下活动,多家国内、外一线AI头部创业公司到现场与超百位AI创业者进行交流。
本期内容整理自活动圆桌讨论。
嘉宾
Lifewood 创始人&CEO 张伟贤
Xorbits未来速度 CEO 秦续业
InfiniFlow英飞流 CEO 张颖峰
Q1:企业应该如何有效将生成式AI和大语言模型落地到商业应用中?三位嘉宾有哪些与主流观点不同的独到见解?
InfiniFlow英飞流 CEO 张颖峰:
我首先想分享两个与主流看法不同的观点。首先,大家似乎普遍关注token的问题,例如最近一些融资颇丰的公司,包括一些开源项目,比如Stream LLM等。对于这些上下文token数的追求,我个人认为并没有特别大的意义。因为我们面临的一个更为重要的问题是幻觉,在真正为ToB企业服务时,这可能也是我们面临的最大问题之一。
为什么token数量不是最大的痛点,主要是因为我们可以通过类似RAG的方式来缓解。RAG检索出来的结果实际上token数量并不多,但即使RAG给出的结果已经很准确,我们发现现有的大量模型给出的结果仍然是基于我们给定的上下文,而这部分token可能只有几千,不会超过1万。基于这种给定的上下文,它仍然是一种幻觉,并且我们很难去控制。这是第一个与主流看法相悖的观点。
第二个与主流看法不同的观点涉及我们主要业务,即向量数据库作为大模型的记忆。然而,需要明确的是,我们不能单纯将其视为唯一的记忆形式。实际上,根据我们的观察,当真正将其应用于ToB时,向量仅仅是一种召回手段,至少根据我们的经验,需要至少两种方式。一个是向量检索作为稠密召回,另外还得再加上一个稀疏召回,就是我们传统全文搜索,这是不可或缺的。值得注意的是,即使是向量召回,其权重可能甚至低于全文搜索,因为在搜索的精度上,它目前仍存在一定的差距。因此,这构成了我提到的两个反共识观点。
Xorbits未来速度 CEO 秦续业:
当下大家对LLM的看法很符合比尔·盖茨当年所说的名言,即短期高估、长期低估。在短期内,人们可能会认为这个东西难以控制,包括模型中常提到的不可控性以及hallucination等问题。在这一系列问题中,如果基础模型(foundation model)不能得到显著提升,就可能会面临挑战。目前,很多问题都涉及各种技巧,包括一些数据问题。
其中一个关键问题是如何从模型中解出信息,尤其是在解RAG时,难点在于如何有效提取信息。如果没有这些步骤,很难得到准确的结果。另一个问题是即使你能成功将信息从数据中提取出来,给定一个模型,它可能也无法很好总结这些信息,因此会出现各种问题。总的来说,目前的情况中还包括许多技巧,比如要用 lost in the middle等技巧来进行RAG的处理。
Lifewood 创始人&CEO 张伟贤:
整体来讲,尽管AI辅助标注在生成式AI出现之前已经存在,但生成式AI的发展无疑为数据标注行业带来了新的机遇和挑战。这要求数据标注公司不仅要继续优化现有的AI标注工具和流程,还要积极探索生成式AI技术以拓展其业务范围和提升竞争力。对于我们来讲,它可以更自动化我们的工业化数据生产流程、进一步提高标注品质和效率,并为我们带来新的业务机遇。
在LLM的实施过程中,数据就像是烹饪中的主要食材,算法就像是烹饪方法,算力像是厨房设备,模型则类似于最终的菜品设计。数据在LLM的发展和应用中起着至关重要的作用,就像食材在烹饪过程中的作用一样。
没有数据,就像是没有食材的厨房,即便有最先进的设备和最精湛的烹饪技巧,也无法制作出美味的菜肴。无论是数据的质量、多样性、实效性还是在特定领域内的独特应用,都对最终模型的效果产生着深远的影响。正如您所描述的,数据不仅是整个过程的基础,也是创新和效率的关键。
Q4:能否谈谈Xorbits未来速度在开源方面的实践经验?
Xorbits未来速度 CEO 秦续业:
我们专注于从开发者的角度构建开源产品,即开源大模型的民主化,关键在于让大家能够轻松地使用它,这是至关重要的。因此,我们在开源方面非常注重易用性,致力于屏蔽各个模型之间的差异。
通过简单的一行命令,用户就可以启动我们的服务。然而,在这个过程中存在许多问题,不仅仅是屏蔽差异。在中国,一个主要问题是使用hugging face时可能会受到审查,给大家下载模型带来了很大的困扰。我们正在积极解决这些问题,与国内平台合作,提供国内下载方式等,以真正解决用户使用模型的问题。同时,我们关注性能和性价比,努力降低成本,这对商业非常重要。
Q5:数据库和数据在我们去使用LLM进行开发应用的过程中有哪些关键价值点?
InfiniFlow英飞流 CEO 张颖峰:
我们近期的经验表明,在处理RAG时,通常可以省略微调这一步骤。这并不是说微调不必要,而是通过RAG,我们将大模型置于ToB场景,避免了可能无法达到60分的情况。换句话说,只有在RAG完成后,才能达到这一水平。
尽管微调可以将得分从60提升至70,但在当前情况下,我们更迫切地需要先解决这个60分的问题。为了达到这一目标,就必须解决一系列相关问题,而不仅仅是简单搭建开源项目,如LangChain和llama_index等。关键是要应对在这一路径中可能遇到的各种麻烦。
在处理文本时,首先要考虑的是向量。向量在切词方面非常敏感,如果切分不准确,无论是过于粗粒度还是过于细粒度,都会影响与向量的映射关系,最终导致失败的效果。切分过细可能导致丧失全局语义,而过粗则在检索时丢失精确的局部语义,这是第一个问题。
第二个问题涉及对不同类型的数据处理,特别像国内企业常用的PDF格式。如何解析其中的文字是一个挑战,如果不经过处理,文字可能会混乱不堪。尤其是在一些复杂的替代情况下,例如论文或金融研报中的不同文字块,如果不进行处理,这些文字可能会混合在一起,使得语义变得混乱,无法构建有序的结构。
在更复杂的情境下,比如涉及大量表格数据时,使用RAG需要解决一些挑战。首先,需要实现自动提取表格数据的功能。其次,必须确定表格中的每一行和每一列是否正确识别。此外,还需要了解表格中不同元素的含义。如果不能通过自动算法来处理这些任务,RAG将无法在这些场景中有效执行。
因此,在实施人工智能时,企业往往面临着高度理想化的要求。从一开始,对于语言模型或者结合RAG的模型,企业对其问答能力的要求可能过于理想化,期望其具备无所不知且高度准确的特性。然而,这是一项具有挑战性的任务,因为向量仅代表一种模糊的语义召回,仅能识别文本的含义而难以达到无所不知的标准。
在企业场景,检索的精确性是至关重要的。仅仅使用向量召回是不够的,可能会导致召回相似度较低的内容。为了解决这个问题,我们需要辅助工作。例如,基于我们的经验,全文检索是必要的。结合行业字典(如金融、法律、医疗等)进行分词,才可以确保准确召回。基于全文检索的精确召回跟基于向量检索的语义召回,在混合后,排序依据可能是全文召回的权重反而更高,更可能满足用户的检索意图。
再比如,如果我们需要提供代码生成服务,通常可以使用code llama,可以直接采用模型进行操作。但在企业内部,如果我们想基于企业内部的代码进行生成,我们可能需要获取企业内部的文档和代码数据,这就需要引入RAG。
在企业内部的代码中,可能会涉及大量的ERP、CRM以及各类业务流程代码。我们可以通过模型将其向量化,但仅仅依靠向量是不够的。我们还需要使用图数据库,例如将代码中的需求放入图数据库中,并同时建立需求图库与每个代码中的实现方式之间的映射关系。通过这种方式,可以实现基于企业内部代码的生成。
再比如,在金融领域,我们可以将知识图谱以图数据库的形式存储,用于风控。将向量和图结合应用在这方面是非常常见的。当用户向模型发起提问时,模型不仅将数据转化为向量,还会生成查询语句。这时,模型可能对数据进行多方面提问,包括向量检索、图检索以及全文检索等多路召回。
此外,对于需要对多个表的数据进行权限过滤、连接以及聚合的情况,我们也需要对这些精准信息准确提取,这些需求都可以体现在一个统一的查询语句中,而非单纯的一条向量。不同类型的数据最终都放到一个数据库中,伴随大模型一起共同工作,这是我们的使用经验。
Q6:大语言模型和AI产品在商业化落地过程中应该考虑哪些关键因素?
InfiniFlow英飞流 CEO 张颖峰:
这一问题实际上面临相当大的挑战。当前,数字化转型对企业而言已不再足够引人注目,更直接探讨人工智能化可能更具吸引力。在与客户进行沟通时,不能再简单地提及数字化,而是需要强调数智化。在具体的执行过程中是否需要人工参与,答案是肯定的。然而,这种人工的角色是为了尽可能实现自动化的流程建立,因为需要根据用户对结果的反馈来调整检索、召回和文字切分策略,这是当前技术条件下保证最终RAG交付效果良好必不可少的步骤。
在当前的商业环境中,企业确实对速度和信息化有更高的需求。这正是我们提供端对端服务的重要性所在。通过我们的服务,客户能够充分利用大型语言模型的潜力,实现数据的有效管理和应用,从而提高业务效率和决策速度。
我们清楚知道,在这个过程中,某些环节可能仍需要人工干预。这并不是技术不足,而是为了确保数据处理的准确性,以及数据隐私的安全性。例如,当我们使用模型进行数据分析或比较时,需要结合专业人员的经验和判断,以确保输出结果的准确性和可靠性。这种人工与自动化的结合是我们服务中一个关键的价值点。
为了让客户认识到我们服务的价值并选择我们,我们强调以下几点:
定制化解决方案:我们理解每个客户都有独特的需求。因此,我们提供的不仅仅是标准化服务,而是根据客户的具体情况定制解决方案,以满足他们特定的业务需求。
数据真实性和准确性:在处理和分析数据时,我们确保数据的真实性和准确性。我们知道客户关心的是具体、可量化的结果,而非空洞的承诺。因此,我们的服务重点在于提供可靠和准确的数据支持。
成本效益:我们的服务旨在提供高效且成本合理的解决方案。通过优化工作流程和利用专业技术,我们帮助客户减少不必要的支出,同时提高业务效率。
人工与自动化的平衡:我们的服务融合了人工智能与人类专业知识的优势,确保在保持高效的同时,也维护数据处理的高标准。
总之,我们的服务专注于满足企业在速度和信息化方面的需求,同时通过结合人工和自动化的方法,确保服务的高质量和效率。我们相信这种综合方法是吸引客户选择我们服务的关键。
Q7:开源会给AI技术公司带来哪些影响?以及AI产品是否必须走向全球市场?全球化是一条不可避免的道路吗?
InfiniFlow英飞流 CEO 张颖峰:
开源是全球性趋势。开源代码应该托管在全球范围的GitHub平台上。开源本质上是一种高性价比的市场推广方式,在AI和数据基础设施领域,特别是对于创业公司,开源是必不可少的,它通过在开发者当中确立标准来实现低成本的推广。
至于盈利,开源与云服务并非完全一件事。开源是有效的推广手段,但具体的盈利模式可能依赖于云服务,而云服务本身并不一定是开源的。在推出SaaS之后,云服务也必然是全球化的。
Xorbits未来速度 CEO 秦续业:
在当前局势下,面向企业的AI产品,全球化可能面临一些挑战。在企业到个人模式下,产品的上限可能受到限制,在全球化方面需要审慎考虑。总体而言,全球化对AI产品可能是必经之路,但执行时应根据具体情况,考虑政治、市场等各种因素。
此外在选择全球化策略时,需要综合考虑公司属性、定位以及目标用户群体等因素。例如,面向B端用户时,纯粹的PLG可能较难实现,具体选择需结合产品特性和公司战略。对于面向开发者的中间词建议服务,在提供在线推理服务时,成本相对较低,但需注意美国市场竞争激烈,需要找到差异化点,避免陷入价格战。选择全球化还是局限于美国市场,应根据公司属性和市场情况做出明智决策。
Lifewood 创始人&CEO 张伟贤:
我们这一代人正处在一个历史性的变革之中,面对的挑战即使是经验丰富的管理者也感到前所未有。作为中国人,我们怀抱着在全球舞台上展现中国梦的渴望,然而,梦想的实现绝非易事。
我们曾渴望成为行业的领军者,但在短短两到三年内,便发现自己在推动愿景方面陷入了停滞。尽管在北京等中国本土市场占据显著份额,但面对全球化带来的加剧竞争,我们仍需应对不断变化的竞争格局。
全球化进程目前处于一种微妙的平衡状态,许多公司在追求全球扩张的过程中走向分裂。这种现状强调了在处理全球化问题时,我们需要更加审慎和策略性。例如,新加坡在美中关系中保持的中立态度提供了一种对全球局势平衡的视角。在全球化的挑战下,特别是在大语言模型应用方面,我们面临着一个既不能完全中立也不能过于明显站队的困境。全球化尽管普遍存在,但并非理想状态。
面对诱人的投资机会,我们应该保持谨慎,权衡投资的决策。设定清晰的短、中、长期目标,规划人生的每一个阶段,同时,开源可以作为应对压力的一种策略。在此过程中,我们应保持冷静,合理观察和投资。确保在最初的三年内生存下来,努力争取五年的成长,并最终达到七年的目标,这取决于个人的命运和努力。
全球化不仅仅是物理上的扩张,更是文化和策略上的适应。深入理解并尊重每个市场的独特性是成功的关键。
Q9:AI数据服务行业在未来将会如何发展? Lifewood 如何定位自己在行业的长期价值?
Lifewood 创始人&CEO 张伟贤:
我们认识到,随着AI和机器学习技术的进步,数据标注服务行业将面临自动化和智能化的挑战和机遇。同时,数据质量、安全性和偏见问题也将成为我们需要重点关注的领域。
首先,未来几年,我们预期AI数据标注服务行业将会经历几个关键转折。首要变化便是自动化和智能化的提升。随着深度学习和自然语言处理等技术的发展,自动化标注和半自动化标注将会越来越成熟,这将大幅提高标注效率,同时减少人为错误。
然而,这并不意味着人工标注的消失,相反,对于复杂任务和高精准度要求的项目,人工标注的价值将更加凸显。同时,我们也非常重视人工智能中的数据偏见问题。我们深知,如果训练数据包含偏见,那么由此训练出的AI模型也可能会有偏见。我们也一直在积极解决这类问题,例如通过多元化的数据采集和公平性的数据标注来减轻数据偏见。我们也正在对我们的标注团队进行反偏见培训,以确保他们能够在数据标注过程中保持公正和公平。
其次,随着AI和机器学习应用的普及,对于训练数据的需求量和质量都将有所提升。这就要求我们能够提供更高质量的标注服务,满足AI模型训练的严格要求。
此外,数据隐私保护和合规性也是未来数据标注行业的重要话题。新的数据保护法规,如欧洲的GDPR和加利福尼亚的CCPA,对数据处理和管理提出了更高的要求。数据标注公司需要提升数据安全和隐私保护的能力,以确保在全球范围内的合规性。
最后,我们始终以客户为中心,致力于提供优质的客户服务和个性化的解决方案。我们了解,每一个客户都有他们独特的业务需求和目标,因此,我们的团队一直致力于理解客户的需求,提供符合他们需求的数据标注服务。
观众提问1:能否分享一下InfiniFlow英飞流公司使用图神经网络的具体情况?
InfiniFlow英飞流 CEO 张颖峰:
我们没有采用图神经网络,而是用到了图数据库。有一些潜在的应用场景,其中之一是在企业内部提供代码生成服务。在这种情境下,引入图数据库更为方便,因为企业需求文档呈现图谱状层次结构,图数据库能够更灵活地应对这类检索需求,而代码则利用向量实现语义召回。
另一个实际应用场景是在金融领域。在这个领域,人们可能已经投入大量的资金来构建知识图谱。如果因为引入大模型而把它放弃显然是浪费的。因此,我们将知识图谱存储在图数据库中,以支持准确的检索。与此同时,我们结合向量进行语义检索,将这两者巧妙地融合在一起。这是我们观察到的两个实际案例。
观众提问2: 第一,向量与图之间是什么样的关系?第二,针对数字化和企业内部运营效率的周期性影响,尤其在交付方面。如何确保最终盈利?
InfiniFlow英飞流 CEO 张颖峰:
在使用知识图谱时,图与向量的结合是不可或缺的,分别代表精确检索和语义召回。这两者的综合运用对于处理类似需求映射的任务至关重要。
然而,这种结合在通用性方面存在挑战,需要定制化。在构建图数据库或处理代码需求时,对于函数的映射关系可能需要使用多个向量,这增加了复杂性。
尽管这项工作可能显得繁琐,但对于项目的成功至关重要。特别是在服务不同企业时,通用化技术变得更为迫切。在ToB服务中,必要的按人天收费的项目定制交付是必不可少的,这是中国市场不同于美国的地方。
我们正试图在技术上实现通用化,例如针对行业的标准RAG解决方案,还有我们研发的AI原生数据库,它们是保证业务盈利具备可扩展的关键。但在具体面向某些B端用户的时候,仍需要加上根据实际定制工作量来进行收费的部分。