AI视野:OpenAI推新模型GPT-4-0125-preview;阿里Qwen-VL升级更新;苹果播客新增转录功能;AI写真项目InstantID在GitHub爆火
欢迎来到【AI视野】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。
新鲜AI产品点击了解:https://top.aibase.com/
🤖📱💼AI应用
OpenAI不服GPT-4被Bard反超 推出最新模型GPT-4-0125-preview
【AiBase提要:】
😲 Bard搭载了新版大模型Gemini Pro-scale
😠 网友质疑混合在线和离线大模型
🔄 模型GPT-4-0125-preview已入场竞技场
Finalframe即将推出适用于AI生成视频的剪辑界面
要点:
⭐ Finalframe支持文本转视频和图像转视频
⭐ 支持创建、打开、保存项目,以及导出完整时间轴
⭐ 即将推出的新功能让视频剪辑方式更直观方便
官网地址:https://top.aibase.com/tool/finalframe
WhisperKit开源!可在iPhone和Mac流畅体验实时语音转录
【AiBase提要:】
😃Argmax公司将WhisperKit作为首个项目。
😃WhisperKit以MIT许可证的形式开源。
😃WhisperKit实现了实时语音转文本。
项目入口:https://top.aibase.com/tool/whisperkit
苹果iOS17.4更新:播客应用新增转录功能
【AiBase提要:】
⭐ 转录功能自动生成播客节目文字稿
⭐ 初期支持英语、法语、德语和西班牙语
⭐ 转录文本不包含动态插入音频和音乐歌词
Mistral-Medium意外泄露 神秘新模型“Miqu”击败GPT-4之外的所有大模型
【AiBase提要:】
🤔 Mistral-Medium模型意外泄露,引发AI社区热议,与名为"Miqu"的新模型有关。
🔥 Miqu在EQ-Bench基准上表现强大,与Mistral-Medium相近,但发布者身份神秘。
💥 Miqu身份存疑,是否Mistral-Medium早期版本或Llama70B。
开源地址:https://top.aibase.com/tool/miqu-1-70b
Vary-toy:具有高级视觉词汇视觉语音模型
【AiBase提要:】
📌 挑战与潜力: 大型视觉语言模型在计算机视觉和自然语言处理任务表现出色,但在图像感知能力方面仍有潜力待发。
📌 模型结构: LVLMs采用图像标记作为前缀或交叉注意力进行特征融合,效率受视觉词汇网络的限制。
📌 解决方案: MEGVII Technology的研究人员提出Vary-toy,用于提高LVLMs的图像感知能力。
项目入口:https://top.aibase.com/tool/vary-toy
阿里巴巴多模态模型Qwen-VL升级更新 推出这2个版本
【AiBase提要:】
⭐ Qwen-VL-Plus和Qwen-VL-Max版本推出
⭐ 在多模态任务上与GeminiUltra和GPT-4V相当
⭐ Qwen-VL-Max在视觉推理方面展现卓越能力
试用地址:https://huggingface.co/spaces/Qwen/Qwen-VL-Max
AI实时对话系统WhisperFusion:集成大模型,与AI无缝语音对话
【AiBase提要:】
1. 🎙️ 实时语音转文本:利用OpenAI WhisperLive实现即时将口语转换为文本。
2. 🧠 大型语言模型整合:集成Mistral大型语言模型,提升对转录文本的理解和上下文把握。
3. ⚙️ TensorRT优化:LLM和Whisper均经过TensorRT引擎优化,确保高性能和低延迟处理。
📰🤖📢AI新鲜事
Midjourney使用1.6万名艺术家数据库进行训练遭批判
【AiBase提要:】
📌 艺术家反应:艺术家指责公司侵权
📌 法律诉讼:涉及多方提起集体诉讼
📌 艺术家作品未经许可被用于训练AI程序
Open AI否认报告称ChatGPT泄露了用户密码
【AiBase提要:】
😡 OpenAI否认ChatGPT泄露密码
😡 Ars Technica报道泄露工单及网站登录凭证
😡 ChatGPT遭指控为漏洞百出
AI写真项目InstantID在GitHub引爆热潮
【AiBase提要:】
⭐ AI写真项目InstantID在全网刷屏
⭐ 项目背后是来自小红书的 InstantX 团队
⭐ InstantID出图速度快,不需模型训练,支持多种风格
项目地址:https://top.aibase.com/tool/instantid
微软等公司财报低于预期 美股AI相关巨头市值一夜蒸发1900亿美元
【AiBase提要:】
📉 微软、Alphabet和超微公布季度业绩低于预期。
💻 与AI相关的公司市值一夜蒸发1900亿美元。
📉 英伟达的股价在1月份上涨了27%,但在盘后交易中也回落了2%以上。
美国点评网站Yelp将加强AI功能 部分功能已在iOS版上线
【AiBase提要:】
👉 Yelp的新功能包括AI生成的摘要和首页重新设计
👉 AI生成的摘要将简洁地介绍商家的特色和服务
👉 摘要功能已在iOS上推出,未来会扩展到Android和网页
MIT最新研究:纯文本模型也能训练出视觉表征 用代码就能作画
【AiBase提要:】
👁️ 纯文本模型训练视觉概念表征的新可能性
💻 语言模型无法直接处理像素形式的视觉信息
🌈 语言模型在生成复杂场景方面表现出色
论文地址:https://arxiv.org/pdf/2401.01862.pdf
首个图像序列基准测试Mementos开源 GPT-4V/Gemini竟看不懂漫画!
【AiBase提要:】
🤔 Mementos测试的关键目的是测试多模态大语言模型的推理能力。
😟 对于GPT-4V和Gemini等模型,在图像序列推理中表现不足20%。
🤯 Mementos测试发现模型容易产生对象幻觉和行为幻觉。
项目地址:https://mementos-bench.github.io/
200GB!AutoMathText:专注数学文本的超大规模数据集
【AiBase提要:】
1. AutoMathText是一个庞大的数学文本数据集,总体规模达到200GB,汇聚了来自多个来源的数据,适用于多种应用场景。
2. 数据集包含10亿到100亿的数据量级,提供丰富的资源供大规模模型训练。
3. AutoMathText提供了详细的领域标签,涵盖数学推理、推理、微调等方面。
高效机器人学习软件SERL25分钟学会一个任务
【AiBase提要:】
⭐ 机器人学习软件SERL通过更少的尝试快速学会新任务
⭐ SERL可执行多种复杂任务,如组装电路板、布线或移动物体
⭐ 这一软件工具包已经教会机器人执行多种任务,包括组装电路板、布线或移动物体到新位置
项目地址:https://top.aibase.com/tool/serl
浙大校友联手微软开源LLaVA-1.5,硬刚GPT-4V
要点:LLaVA-1.5在11项基准测试实现了SOTA,使用8块A100GPU,LLaVA-1.5的训练仅需1天时间即可完成。LLaVA-1.5在多模态理解上超越GPT-4V,可对其形成有力竞争。LLaVA-1.5采用最简单的架构和公开数据集,性能显著提升。站长网2023-10-08 14:07:230000马斯克爆粗口怒喷广告商:别利用投放广告来敲诈威胁我
在最近的DealBook峰会上,马斯克接受采访时对包括苹果、迪士尼在内的数十家广告商进行了激烈的言辞攻击。他直截了当地表示,如果这些广告商试图利用投放广告来敲诈他或威胁他,他将不予理会,甚至用粗鲁的语言表达了自己的不满。此前,由于马斯克在X平台上支持一条被视为反犹的帖子,一些大型广告商为了抵制他,暂停了在平台上投放广告。站长网2023-11-30 14:04:000000苹果推出iOS16.6.1正式版更新 提供安全性修复
苹果公司在今天凌晨推出了iOS16.6.1正式版升级,版本号为20G81,距离上次更新已经过去了45天。此次更新主要提供了重要的安全性修复,因此苹果建议所有用户进行安装,以确保手机系统的安全稳定。苹果公司目前已经将重心放在了即将发布的iOS17上。这意味着iOS16的更新不会再增加新的功能,已经接近尾声。站长网2023-09-08 08:21:290000AI绘图模型训练到推理,一个网页就能搞定
不会写代码,也能训练AI绘画模型了!只要借助这个框架,从训练到推理都能一站式搞定,还能一次管理多个模型。阿里巴巴团队推出并开源了这款万能图片生成工作台SCEPTERStudio。有了它,不用代码,直接在Web界面当中就能完成模型的训练与微调,并管理相关数据。团队还推出了内置三种模型的DEMO,可以在线体验SCEPTER的推理功能。那么SCEPTER具体都能干啥,下面就来一睹为快!站长网2024-02-18 09:22:070001阿里发布夸克扫描王APP 搭载AI大模型技术
阿里智能信息事业群发布了夸克扫描王APP,这是一款手机扫描产品,搭载了AI大模型技术。夸克扫描王APP可以高效地解决文件整理问题,无论是在工作、学习还是生活中,它都可以帮助你扫描文件、提取资料、拍摄证件照、进行文件格式转换和智能消除不需要的内容。站长网2023-08-29 14:22:450000