In the Loop 主持人 Ejaaz Ahamadeen 解释了 Cerebras (CBRS) 芯片与传统 AI 芯片的不同之处,以及为什么随着 AI 竞赛日益归结为速度,更快的推理可能成为关键优势。
现在,当你查看 Cerebrus 芯片时,它们将内存与 GPU 结合在一起,所以这只是你所关注的一件事。因此,从向 Cerebrus 芯片上运行的模型发送提示所花费的距离或时间要短得多。
它更贵,但更短、更快,这意味着您可以立即快速地给出响应。现在,Cerebrus 芯片的内存容量约为 44 GB。
如果你想一想,今天的现代模型价值数 TB 的数据,特别是如果你看看它们的模型权重。因此,你仍然需要多个这样的 cerb 条才能使其发挥作用,但如果你愿意支付前期成本,你可以如此迅速地为这么多人提供服务,这对于 Jane Street 或像 Jane Street 这样的其他公司来说非常有价值。
这就是 Cerebrus 的独特卖点。我们卖的是更快的推理。但后来我开始思考,好吧,无论是 Cerebrus 还是其他任何公司,快速推理的实际市场机会是什么?比如,是否只是像 Jane Street 这样的交易算法公司,或者是否有其他公司可以使用这样的芯片或支付溢价来获得这样的芯片,以便他们可以击败竞争对手并赚很多钱?
嗯,答案是肯定的,您一定会想听听这个。所有这些以及高通今天为您带来的 In the Loop 节目中的更多内容。
现在,在我解释哪些行业正在使用超快速推理芯片之前,我认为向您展示这些芯片的速度非常重要。我有一个有趣的小演示,是我使用 clawed 生成的,以了解它是如何工作的或者它对你来说如何。那么,您在屏幕上看到的就是在 ChatGBT 或任何 AI 模型中输入平均查询时会得到的标准响应交付,对吗?
所以它看起来像这样。这就是它给出答案的速度。速度相当快,对吧?所以对于普通人来说,这很好。您不需要比这更快的推理速度。但随后你就会转向企业。那么让我们更进一步吧。
这是 Nvidia 的超快速度,如果您眨眼,您可能会错过该演示。让我再运行一次。 Super quick, right?所以,就像是,你眨一下眼睛,你的答案就已经在那里了,对吧?
如果你是一个普通人并且你想更快地得到结果,那么它就没那么有用了,当然,很好,谁在乎呢。我只是想要谷歌查询。我只是想知道这个食谱是什么。所以我不需要太快。你可以慢一点给我。我不想为此每月支付 500 美元。那完全没问题。但如果你是 Jane Street,信息、毫秒、秒的影响小到 T 可能会导致一笔交易损失数千万到数亿美元。
这就是 Cerebra 每秒 750 个代币的超快速度。你明白了吗?让我们再试一次。
又来了。又来了。从字面上看,我看着这个,我眨着眼睛,但我仍然想念它。
太疯狂了。就好像它刚刚出现或出现在您的屏幕前一样。现在,只用了0.2秒就出现在我们面前。
所以 Cerebrus 的目标是每秒 5,000 个代币,看起来像这样。你实际上看不到它,因为它,我认为这不准确,但它说的是 0.0 秒,呃,这可能对于普通人来说,你不一定能听懂。他们的想法是,他们不为零售客户提供服务。这些芯片的全部目的不是为零售客户提供服务,而是为时间紧迫的企业提供服务,这可能会花费您数百、数百甚至数十亿美元。