谷歌被打脸!Gemini Pro被证实和GPT3.5差距不大
要点:
在CMU的研究中,Gemini Pro被与GPT-3.5和Mistral8×7B进行了深入的比较,结果显示GPT-3.5在多个任务上几乎全面优于Gemini Pro,但差距不大。
通过测试任务包括基于知识的问答、通用推理、数学问题、代码生成等领域,Gemini Pro在某些任务上表现较差,但在特定任务中超越了GPT-3.5。
文章强调Gemini Pro是多模态的,通过视频、文本和图像训练,而GPT-3.5Turbo和GPT-4Turbo主要基于文本,Mixtral是开源竞争对手。
谷歌最新发布的Gemini Pro自发布以来备受瞩目,谷歌声称其优于GPT-3.5。然而,CMU的研究通过深入的实验对比,展示了GPT-3.5在多个任务上的全面优势。Gemini Pro虽然在某些任务上稍显不足,但整体表现与GPT-3.5相近,为大模型领域的竞争增添了新的火花。
论文地址:https://arxiv.org/pdf/2312.11444.pdf
研究涉及了基于知识的问答、通用推理、数学问题、代码生成等多个领域。在基于知识的问答任务中,Gemini Pro在一些子任务上落后于GPT-3.5,尤其在多选题答案输出中显示了一定的偏见。通用推理测试中,Gemini Pro的精度略低于GPT-3.5Turbo,尤其在处理较长、复杂问题时表现不佳,而GPT-4Turbo则表现更为稳健。
数学问题领域的测试包括小学数学基准、稳健推理能力、不同语言模式和问题类型等。Gemini Pro在某些任务上略显不足,特别是在多样化的语言模式任务中,表现较GPT-3.5Turbo稍逊。在代码生成方面,Gemini Pro在两项任务上的表现均低于GPT-3.5Turbo,与GPT-4Turbo相比则差距更大。
总体而言,Gemini Pro作为多模态模型,尽管在某些任务上稍显不足,但在特定领域表现出色,超越了GPT-3.5。然而,在大多数测试中,GPT-3.5Turbo仍然保持领先地位,证明其在开源模型中的卓越性能。这一研究为科技领域的大模型竞争提供了客观中立的第三方对比,为未来的模型发展提供了有益的参考。
首个三维具身通才智能体LEO:全面掌握感知、推理、规划、行动
要点:LEO是首个具身通才智能体,以GPT-4等大语言模型为基础,实现了在三维世界中的感知、推理、规划、行动等多任务多模态能力。该研究填补了多模态大语言模型在三维世界任务上的空白,通过高效学习策略和数据生成方法,构建了一个能够在真实场景中应用的通才智能体。LEO在三维场景问答、物体描述、具身推理等任务上表现优异,具备在家庭助理、智能导航、机器人操作等领域广泛应用的潜力。站长网2023-12-08 18:51:350000AI搜索引擎You.com宣布在WhatsApp推出搜索功能
AI搜索引擎You.com宣布在WhatsApp上推出人工智能搜索功能。现在,用户可以通过WhatsApp使用You.com,只需向You.com发送问题,即可获得即时答案。用户可以通过WhatsApp、网页和移动应用等方式使用You.com,免费体验无限量的AI聊天和搜索功能。站长网2023-08-24 23:31:510000SEINE:将短视频平滑过渡为长视频
最近,视频生成工具越来越受欢迎,特别是用来创建短视频的工具。然而,这些工具在处理长视频时往往表现出一些限制。然而,近日发布的SEINE工具却能帮助用户解决这个问题,它能够将短视频平滑地过渡变成故事级的长视频。项目地址:https://vchitect.github.io/SEINE-project/代码:https://github.com/Vchitect/SEINE站长网2023-11-02 11:12:030000LLM-Adapters:将各种适配器集成到大型语言模型中
站长网2023-08-17 16:17:570000小鹏汽车:城市NGP在北京正式开放
今日,小鹏汽车宣布,城市NGP在北京正式开放。这是行业内首个在北京城区内开放的高等级智能辅助驾驶,当前主要适用于北京各环线及主要快速路。目前,该功能已面向公测用户开放,并将很快随XmartOS4.3.0版本向G9、P7i的Max版用户推送,同时,小鹏P5P版车型在升级至XmartOS3.5.0后,城市NGP功能也将适用于以上北京城区范围。站长网2023-06-15 11:00:330000