17460

大翻车!斯坦福超火机器人自曝内幕,研究者救场还受伤了,网友:放心了

站长网2024-01-06 15:49:203

爆火的斯坦福全能家务机器人Mobile ALOHA,大!翻!!车!!!

你以为它擦个红酒轻而易举,但实际上却是这样的:

全给你弄撒喽,顺带碎个杯子……

你以为它能化身大厨娴熟烹炒,结果给你上演一个炒锅底:

Mobile ALOHA的翻车大合集还不止这些。

例如刚才炒完虾的锅,哎呦喂,一不小心没拿住:

即使小哥一个箭步冲上去也没阻止“悲剧”的发生(好像还烫到手了)。

这画面,真是像极了庄嫂摔碗……昨天还在“神坛”上的Mobile ALOHA,一夜之间便被曝出了这么多“笨手笨脚”的样子,也是引来不少网友的围观。

然而,这次即使面对翻车铁证,网友们的画风却是一反常态:

它并不完美,不过很可爱。

总会有犯错的余地。

最重要的是:

放心了。(手动狗头)

这到底是怎么回事?

斯坦福团队自曝“丑闻”

原来,这段机器人大翻车的视频,就是由斯坦福Mobile ALOHA的作者Tony Z. Zhao发布的。

并且他还直言不讳地说道:

机器人还没有做好准备接管这个世界。

而这段翻车视频,正是机器人完全在自主模式下所犯的。

用作者的话来形容,就是“最愚蠢的错误”

毕竟除了刚才我们展示的几个例子之外,Mobile ALOHA甚至连锅都放不进橱柜里:

炒完的虾粘锅倒不出来不说,连碗的位置也找不到:

拿支笔也没法找对位置下手:

面对失败合集,作者却是打趣道:

面对失败合集,作者却是打趣道:

这是我目前为止最喜欢的视频了,(不过)当机器人在你面前犯错的时候,你就不会觉得那么有趣了。

确实,毕竟手都被烫了……

不过作者今天自曝这段视频其实应该还有另外一个原因。

因为前两天Mobile ALOHA神级现场的视频确实引来了不小的关注度,不过很多人误以为这是它在自主模式下完成的。

但其实,Mobile ALOHA采用的是混合模式,并非完全自主,作者也呼吁网友们在吃瓜的同时认真看下论文和代码。

值得一提的是,作者还引用了2015年波士顿动力Atlas人形机器人“翻车合集”并向它致敬。

或许这也正如英伟达科学家Jim Fan说的那样:

一步一个脚印。

学习50次,成功率能到90%

就在这两天,Mobile ALOHA团队连续放出三个爆火视频,展示了该机器人敏捷灵巧的家务能力,看呆网友。

包括做满汉全席(磕鸡蛋、给鸡肉翻面这种细活都信手拈来):

包括做满汉全席(磕鸡蛋、给鸡肉翻面这种细活都信手拈来):

套枕套铺床单:

浇花、拖地板、开瓶盖,甚至逗猫猫:

那叫一个人模人样,上得厅堂下得厨房。

不过,大部分都是真人操控的,比如上面这些。

更直观的可以看下面这个抽纸擦玻璃的动图,背后直接站了个人类1:1示范:

不过,对于一些相对简单的任务,例如这个单炒虾仁:

还有刷锅、将餐椅归位、呼叫并乘坐电梯、擦桌子等等,只需真人少量示教,它就可以学会,然后脱离人类进行自主操作。

具体而言,作者介绍,上面这些简单动作目前只需要学习50次就可以做到90%的成功率——

经测试,Mobile ALOHA可以连续9次擦干倒洒了的酒、连续呼叫5次电梯都不会出错,能够保持一定的稳定性。

除此之外,它还能抗干扰,在完成归置锅具到柜子之中时,实验人员不停向它面前投掷杂物,都完全没有影响它发挥:

在训练期间根本看不见的椅子?它也能准确识别并完成归位任务。

那么,作者是如何仅通过50个演示就让Mobile ALOHA实现自主任务的呢?

最关键的是通过ACT或扩散策略进行模仿学习,然后和静态操作数据一起对机器人系统进行联合训练

有了这一联合训练方式,机器人的性能可以显著提高,尤其是那种需要精确操作的任务。

最后,也再次为介绍一遍斯坦福大学的这个机器人成果:

它于今年3月底正式发布,历经了8个月的迭代和2个月的测试。

一共三位作者,其中两位为斯坦福计算机科学专业的华人博士生(最后一位是导师):

当时的这位机器人,就已经能够利用工具完成各种精密细活了,只不过只能在固定的位置:

当然,背后也是真人遥控的。

而正如其名ALOHA全称是“𝐀 𝐋ow-cost 𝐎pen-source 𝐇𝐀rdware System”,这款机器人主打的就是开源和低成本:

全部软硬件设计包括代码和数据都一并发布,而搭建这一个系统“只”需3.2万美元(约合22.7万人民币),具体需要哪些硬件,作者还列了个清单,感兴趣的朋友可以照着DIY。

机器人元年?

几乎和斯坦福的爆火机器人同一时间,谷歌也发布了自家最新的研究成果,并且是一气发了仨:

一个是将机器人决策速度提高14%,同时保持操作准确率不变并增加了10.6%的改进模型;

一个是专攻泛化能力的新框架,用了一种全新方法让机器人完成从未见过任务的成功率从29%提升至63%;

以及一个可以同时容纳20个机器人的收据收集系统,将用于加快机器人理解人类指令的能力的训练。

这些新成果全部用于升级谷歌的机器人大模型RT-2。

和斯坦福的Mobile ALOHA对比起来,谷歌的RT-2表现还是高冷一些,但它所有效果都是全自主的。

除了这两家,李飞飞团队也一直在跟进,其名为VoxPoser的机器人系统也已经可以听懂人话完成各种指令,并且无需额外训练。

这不由地让人想到,不少人那句“2024会是机器人元年”的预言:

你觉得会成真吗?

你觉得会成真吗?

参考链接:

https://twitter.com/tonyzzhao/status/1743378437174366715

0003
评论列表
共(0)条
login
相关推荐
  • 英特尔团队提出L-MAGIC新技术 通过结合语言模型让图像扩散模型生成高质量360度场景

    在CVPR2024上,美国英特尔研究院的蔡志鹏博士及其团队提出了一种名为L-MAGIC(LanguageModelAssistedGenerationofImageswithCoherence)的新技术。这项技术通过结合语言模型和图像扩散模型,实现了高质量、多模态、零样本泛化的360度场景生成。核心特点:
    站长网2024-06-12 00:07:20
    0000
  • 真我GT7 Pro正式发布:售价3599元起 搭载骁龙8版处理器

    今天下午,真我GT7Pro正式亮相,该手机提供了多种存储组合和价格选项,其中12GB256GB版本售价3599元,12GB512GB版本售价3999元,16GB256GB版本售价3899元,16GB512GB版本售价4299元,而顶配的16GB1TB版本售价4799元。真我GT7Pro带来了火星探索版、星迹钛、光域白三种配色,满足不同用户的审美需求。
    站长网2024-11-05 17:08:25
    0003
  • 小红书提出创新框架:充分利用负样本提升大语言模型推理能力

    要点:小红书搜索算法团队在AAAI2024上提出了一种创新框架,利用负样本知识来提升大语言模型(LLMs)的推理能力。他们设计了一个模型专业化框架,包括负向协助训练(NAT)、负向校准增强(NCE)和动态自洽性(ASC)等序列化步骤,全面利用负样本在知识蒸馏中的关键作用。
    站长网2024-01-24 16:59:13
    0006
  • 真我GT5 Pro首发超硬铝金属中框 抗摔性能提升40%

    真我GT5Pro宣布将放弃普通金属中框,不惜成本首发超硬铝金属中框,其强度甚至超过了钛合金,抗摔性能也提升了40%。值得一提的是,真我GT5Pro这次采用了双曲面直边的设计方案,不仅时尚简约,还能呈现出曲面屏的握持手感,两者兼顾。同时,超大的圆形后摄采用了居中放置的设计,这也是真我历史上首次使用这种方案。
    站长网2023-12-01 10:13:30
    0003
  • 微软推出ND H100v5虚拟机系列 配备8个英伟达H100芯片

    微软推出了全新的NDH100v5虚拟机系列,该系列配备了最新的NVIDIAH100TensorCoreGPU和NVIDIAQuantum-2InfiniBand网络。这款虚拟机具有AI超级计算GPU、新一代CPU、低延迟网络、优化主机到GPU的性能以及大规模的内存和内存带宽等特性,能够提供无与伦比的计算能力。
    站长网2023-11-21 09:06:45
    0002
  • Meta 更新帮助资源中心:加入「生成式 AI 数据主体权利」表单

    站长之家(ChinaZ.com)8月31日消息:Facebook用户现在可以删除一些个人信息,这些信息可能会被公司用于训练生成式人工智能模型。Meta本周在其网站上更新了Facebook帮助中心资源部分,添加了一个名为「生成式AI数据主体权利」的表单,允许用户「提交与第三方信息有关的请求,这些信息被用于生成式AI模型的训练」。
    站长网2023-08-31 09:01:04
    0002
  • 猴子无限CEO尹伯昊:借助大模型构建个性化体验,是新时代的财富密码

    随着生成式AI与大模型技术的发展,创业机遇大量涌现,但也引发了行业对于“大模型创业是否是巨头游戏”的讨论。对于企业和个人来说,究竟如何借助大模型赚钱?有哪些是我们真正可以抓住的机会?7月14日,猴子无限CEO尹伯昊在「AIGC赋能·重塑内容生态」2023新榜AIGC生态大会上围绕《用每个人的专属大模型打造个性化内容》这一主题,分享了他对大模型时代财富密码的思考与判断。
    站长网2023-07-26 18:14:33
    00017
  • Meta 旗下 WhatsApp 在 Beta 版中测试人工智能生成贴纸

    Meta旗下的WhatsApp开始测试一项新的AI生成贴纸功能。WABetaInfo报道称,Android版WhatsApp测试计划中的一些测试人员已经发现了这种新的AI驱动的贴纸功能,允许WhatsApp用户基于文本描述生成贴纸。
    站长网2023-08-16 11:49:08
    0002
  • 智谱AI发布评分模型CritiqueLLM 可评估文本生成模型性能

    近日,智谱AI发布了高质量、低成本的评分模型CritiqueLLM,用于评估文本生成模型的性能。传统的评价指标如BLEU和ROUGE主要基于n-gram重合度来计算评分,缺乏对整体语义的把握。而基于模型的评价方法则对基座模型的选取非常依赖,只有顶级的大模型才能取得令人满意的效果。
    站长网2023-12-12 14:41:50
    0003
  • 明日开卖!没有预售的618,电商平台迎来大变化

    一条沿用多年的大促规则,在今年618被电商平台亲手砍掉。5月,淘天、京东、快手纷纷宣布,全面取消预售制度,直接开卖现货,抖音电商随后跟进。各平台大促周期与核心玩法如下:部分电商平台规则尚未完全公布预售大规模消失的第一个年头,所有玩家都将游戏规则指向“简单”二字,不过从时间跨度来看,618战线并未缩短,部分平台甚至堪称“史上最长618”。
    站长网2024-05-19 09:28:49
    0003