公司概况
成立时间:2023年4月28日
地点:法国巴黎
创始人:Arthur Mensch、Guillaume Lample、Timothée Lacroix
估值:2023年10月筹集了3.85亿欧元后,Mistral AI 的估值超过20亿欧元。到2024年6月,经过新一轮6亿欧元的融资,其估值飙升至58亿欧元。
Mistral AI 旨在通过专注于开源模型来民主化人工智能技术的获取。这种方法将公司定位为专有人工智能解决方案的替代品,强调透明度和社区参与。
产品和模型
Mistral AI 发布了几个值得注意的模型:
- Mistral 7B:一个密集型变换器模型,优化用于各种任务,包括文本摘要和问题回答。
Mixtral 8x7B:一个稀疏混合专家模型,使用更大的参数池以提高性能。
Mistral Large:于2024年2月推出,该模型旨在用于高级推理和指令跟随任务。它支持包括英语、法语、西班牙语、德语和意大利语在内的多种语言,并可在 Microsoft Azure 等平台上使用。
Mistral Large 2:于2024年7月发布,它具有1230亿参数和128k上下文窗口,使其成为市场上最先进的模型之一。
核心特点
Mistral AI 的模型具有以下特点:
- 多语言支持:精通多种语言,便于从文本生成到编码任务的广泛应用。
- 开源:致力于将其模型向公众开放,促进人工智能社区内的创新和协作。
- 性能:模型优化了效率和速度,使它们适合大量任务和实时应用。
Q:全球能够训练像Mistral这样的人工智能系统的专家并不多。尽管我知道法国的人工智能领域发展得非常繁荣,但你认为自己是否已经成功地吸引了一批懂得如何做到这一点的人才——甚至可能已经囊括了所有这样的人才?
Arthur:并非所有的专家都加入了我们。我们有些朋友还在谷歌、OpenAI工作,还有一些留在了Meta。但可以肯定的是,我们成功吸引了大约15位精通训练这些模型的人才。要准确估计这个领域内专家的总数总是很具挑战性,不过我认为我们可能已经汇聚了当时全球懂得如何处理这类事务的人才中的大约10%。
Q:Mistral一直在进行融资。你打算如何使用这些资金?
此外,我们还非常注重提升模型的效率,致力于增强模型的推理能力,同时力求使模型运行更快、成本更低。
我们正在打造的是这样的产品:一个由我们自行托管的开发者平台,通过API和托管服务向用户交付,同时我们也为客户提供完整的技术部署,让他们能够完全掌控技术。我们提供软件访问权限后,就从整个使用循环中退出,这样客户就能够对他们应用中使用的数据拥有完全的主权控制。
Q:可以说,您的计划是创建性能几乎与竞争对手相匹敌的人工智能模型,但以更低的成本提供给您和您的客户,并且更开放地共享这些技术吗?还是说,您希望在技术能力上与竞争对手的最先进模型,也就是“前沿模型”相媲美?
Arthur:我们确实打算在技术前沿领域展开竞争。目前性能饱和的现象让我们有机会迎头赶上,我们计划继续这种追赶,并最终达到与竞争对手同等的竞争力。然而,我们实际上采用的是一种独特的商业模式,这种模式是其他公司所不具备的。我们在分享、定制和部署我们的技术方面更为开放,即使在那些我们无法持续控制的地方也是如此。
我们致力于站在技术最前沿与对手进行竞争。性能饱和现象(saturation of performance)已经让我们有机会缩小差距,我们将继续这种追赶,并且最终达到与竞争对手一样的竞争力。但我们的商业模式是独一无二的。我们更倾向于在无法持续控制的环境中,开放地分享、定制和部署我们的技术。
Q:最近,Mistral将一些最先进的模型转为了通过API提供给合作伙伴,而不是最初那样完全开放。这种转变背后的原因是什么呢?
Arthur:实际上,这并不是一个全新的改变。我们始终计划在开源领域保持领先的模型,同时提供一些只能通过付费服务访问的高级特性。我们的初衷未曾改变。
我们的产品中有很大一部分是开源的,这使得开发者能够自由采纳这项技术,并基于它构建他们所需的任何应用。随着开发进程的深入,当他们准备将构建的工作负载投入生产环境,或者希望进一步提升应用的性能、效率,降低维护成本时,他们可以转向我们的平台,利用我们优化过的模型来增强性能和推理速度。
我们始终将开源作为我们的核心路径。开源对我们来说至关重要。我们在开源的基础上构建了开发者平台,这自然会涉及商业化,因为我们需要一个可行的商业模式。但我们期望为使用我们开源模型的开发者提供额外的价值。
Q:你经常争辩说,欧洲不能依赖美国的人工智能公司,需要一个本土的人工智能冠军。Mistral是欧洲最著名的人工智能公司之一,但与美国的“超大型企业”Microsoft建立了合作伙伴关系,以获得其所需的计算能力。Mistral在计算方面对Microsoft的依赖是否限制了其扮演欧洲主权AI冠军角色的能力?
Arthur:我们有四家云服务提供商。我们在设计上就是云中立的,这从第一天起就是我们的战略。我们的模型可以通过Microsoft Azure获得,也可以通过[Amazon Web Services]和[Google Cloud Platform]获得。我们使用这三者作为云服务提供商。我们还使用不同的云服务提供商——特别是CoreWeave——进行训练。我们已经建立了自己的技术栈和分销渠道,以构建我们认为客户所需的独立性。
对我们的客户而言,这一点至关重要,因为他们中的一些是来自欧洲,他们希望对自己所使用的云基础设施拥有一定程度的控制权。目前,虽然已有一些可用的资源,我们的平台也已经在欧洲进行了部署,但仍然有提升的空间。这不仅仅是欧洲单方面能够决定的事情。这需要整个生态系统认识到存在的需求,并加以解决。我们期望在不久的将来能够与一些欧洲的云服务提供商建立合作伙伴关系。
关于训练数据集的透明度,还有一些讨论需要进行,这是我们非常希望能够实现的,但同时也需要与商业机密相权衡。我们的很多知识产权也体现在我们处理和选择数据的方式上。这同样也是其他人的知识产权。
作为一家小公司,我们对我们的知识产权非常重视,因为这是我们所拥有的一切。因此,从这个角度来看,我们有信心能够找到一种让各方都能接受的解决方案。
我们已被邀请参与技术规范的制定,并提供我们的意见。我们还期望,欧洲应该在完全独立的情况下做出选择,以促进生态系统的发展,并确保每个人都能满意。
人类一直在创造的一切都是工具,而我们现在引入了一种全新的工具,它带来了新的抽象能力。从某种意义上说,你可以将其视为一种更为抽象的编程语言。自我们开始用计算机能够理解的语言进行编程以来,已经过去了50年。如今,我们能够通过英语、法语或任何语言与机器对话来创造系统。这为开发者和其他人带来了一种新的思考和操作方式,这显然将改变我们未来十年的工作方式。
我相信,如果我们能够正确地做事,并确保这项工具能够被每个人所掌握——这也正是我们创建Mistral的原因——我们就能够确保它为每个人的生活带来改善,无论是在全球范围内,还是在社会经济地位的各个层面。
对我们而言,达成这一愿景的首要步骤是在医疗、教育等关键领域推广极具创新性的应用。至关重要的一点是,我们必须确保技术不仅易于人们获取,而且人们也接受了适当的培训,能够熟练运用这些技术。为此,我们致力于以一种比传统方式更为开放的姿态来分享技术,以此加速技术普及的进程。然而,这还远远不够,政治决策者们也应当担起责任,制定并实施一系列赋能计划,旨在提高全球尚未连通互联网地区的网络覆盖。我相信,我们正在开发的生成性人工智能技术,将在推动人们接触并利用这一变革性工具方面发挥重要作用。
Q:在未来,您能否设想出某种情境,我们开发了一个人工智能模型,或者正在开发中,却意外发现了某些特殊功能?是否有可能我们决定不将这个模型开源,而是选择通过API来限制访问,甚至完全不公开部署?
Arthur:至少在目前和可预见的未来,我们没有这样的计划。我们所构建的模型功能都是可预见和可控的。我们坚信,开源是集体管理和利用软件的最佳途径,这一点在网络安全和操作系统领域已经得到了验证。因此,目前最安全的技术往往也是开源技术。
在某种程度上,人工智能并没有改变软件的本质,而是为我们提供了不必深入了解底层细节就能创建和使用软件的方法。因此,我并不认为开源模型会带来风险,反而只看到了它的好处。这是一个中性的工具,可以用于各种目的。我们不会因为C语言可以被用来编写恶意软件就禁止它,同样,我们发布的模型也是如此。因此,确保市场上应用程序的质量至关重要,但这并不意味着监管技术本身,而是要监管技术的使用方法。