谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万 - 新火种

热门关键词

文心一言 AI copy btc 斑马腾迅 aa 1 iPollo sd

首页 > AI资讯 > 行业动态 > 谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

新火种 2024-05-15

OpenAI出手再次惊艳世界，谷歌果然坐不住了。

GPT-4o掀起的一片“AGI已至”的惊呼声中，刚刚，Google DeepMind首席执行官哈萨比斯亲自携谷歌版《Her》登场：

同样能听会看还有嘴，不仅能几乎没有延迟地和人类流畅交流，通过摄像头，这个名为Project Astra的AI助手甚至能直接帮忙读代码：

谷歌还祭出了自己的硬件优势，带来一波AR和大模型的梦幻联动。

一边撸狗一边玩转大模型已经成为现实（手动狗头）。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

这一波操作下来，战果如何尚未可知，网友们反正是兴奋了起来：

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

而正面硬刚GPT-4o，还只是谷歌铆足了劲，在I/O大会上释出的冰山一角。

两个小时的主题演讲里，AI被提及了121次，CEO劈柴哥还犹嫌不足。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

于是，对标Sora能生成一分钟长视频的视频生成模型Veo来了：

Gemini 1.5 Pro不仅面向所有人开放，上下文窗口还从100万token直接一步迈向200万，一口气能读1500页PDF。

连Android，现在也紧紧跟谷歌大模型Gemini绑定，摇身一变成为以AI为内核的操作系统。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

总之，信息量多到爆炸，相比之下，OpenAI不到半个小时的发布真的很随性了。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

谷歌版《Her》登场

第一时间引发最多讨论的，当然是谷歌版《Her》——Project Astra。

Project Astra基于Gemini系列模型打造，谷歌表示，研究人员们希望这样的智能助手，能真正在人们的日常生活中提供帮助。

有意思的是，OpenAI总裁哥Brockman昨天在场外补充了有关GPT-4o多模态能力的更详细视频，而谷歌这边，哈萨比斯也是第一时间在X上更新了与这样一个智能助手的互动。

看样子，Ta不仅能完成帮忙找眼镜这样的基础工作。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

帮忙搞点文艺创作，解答一下专业书上看不懂的内容，也都是信手拈来。

还有Google DeepMind的工作人员干脆和Project Astra一起看起了I/O大会直播：

不少网友都认为，这是谷歌对OpenAI的GPT-4o的正面回应。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

不过嘛，网友们也关注到了不少问题，比如，Project Astra的延迟似乎还是比GPT-4o长，谷歌的演示中也没有体现是否能打断智能助手说话。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

值得关注的是，Project Astra背后，是Gemini系列模型的进一步升级迭代。

比如，Gemini 1.5 Pro的上下文窗口来到了惊人的200万token。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

谷歌还最新推出了Gemini 1.5 Flash这一轻量级模型，并开源了27B的Gemma 2和视觉语言模型PailGemma。

60秒长视频生成

你可能已经默默在心里比较了一番Project Astra和GPT-4o的高下。

但桥豆麻袋，说起来，谷歌被OpenAI突然狙击，可不止这一回。

还记得在春节期间抢尽谷歌风头的Sora吗？

谷歌的回应，虽迟但到——

谷歌最强视频生成模型Veo来了。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

Veo可以生成1080p的高质量视频，生成视频的长度也看齐Sora：最长超过1分钟。

谷歌还强调，Veo生成的画面一致性出色，并且可以hold住各种风格。比如“延时拍摄”和“航拍”这种术语，直接写在提示词里，Veo都能get。

目前，谷歌已经和电影制作者展开了合作，在电影项目中探索Veo的应用。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

与此同时，谷歌的图片生成模型Imagen也迎来更新，Imagen 3发布。

官方提到，与此前的模型相比，Imagen 3的视觉伪影更少，生成的图像细节拉满，并且在生成文字方面效果也很好。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

△提示词：一张庄严的图书馆入口的照片，刻有“中央图书馆”字样

另外，谷歌此次还推出了音乐生成模型Lyria。

Gemini进入全线产品

在这些跟OpenAI叫板的“肌肉”展示之外，谷歌对大模型应用的看重，也在此次I/O大会中尽显。

英伟达科学家Jim Fan就他的I/O观后感中表示：

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

还不止是搜索，这一次，谷歌可以说是把Gemini塞进了全线产品中，包括谷歌搜索、Android，以及谷歌邮箱、谷歌Photos等。下面我们划划重点。

1、谷歌搜索

基于Gemini，谷歌搜索推出AI概述（AI Overview）新功能，彻底化身AI搜索。

用户在搜索框输入问题，马上就能得到一个AI总结的答案，包括相关链接。

而且是超长问题都能处理的那种，比如：

AI Overview秒秒钟就会列出五星好评且距离灯塔山近的店，并附带课程标价，连店在地图上的位置都标记了出来：

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

对于这种复杂问题的搜索，谷歌表示采用了多步推理技术，可以将复杂问题拆解成一个个小问题，然后自动对问题进行排序回答。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

多步推理加持下，AI overview已经脱离了纯粹的搜索——把制定计划一并搬进了搜索引擎里。

比如直接让它为一个团体制定一个为期三天的易于执行的餐饮计划。

AI overview一键给出了方案，每个方案都可以点击修改，下方还可以一键将食材加入购物车：

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

还没完，当你没有想法、问的问题比较笼统时，谷歌搜索还会AI自动将搜索结果整理成一个个“群组”，为你提供建议。

比如问：在达拉斯找一个餐厅庆祝周年纪念日。

搜索出的结果会按照音乐餐厅、具有历史魅力的餐厅等一键分组。再往下翻，页面会从餐饮逐渐扩展到电影、酒店、购物等。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

此外，谷歌搜索还支持视频搜索了。

演示中，唱片机出故障，只需一边录制视频一边说出疑问，谷歌AI Overview就会立刻分析故障原因，并给出处理建议。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

谷歌搜索AI Overview功能将在本周开始在美国推出，后面将陆续推至其他国家。

2、Android 15

谷歌把Gemini也带到了安卓系统中。

凭借直接内置的Circle to Search功能，用户使用简单的手势“圈”一下手机上看到的任何内容，就能进行搜索。

比如圈出练习题，就能一键获取答案。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

目前这一功能，已在Pixel和三星的部分设备上使用。

此外，还可以在一个应用之上随时调出Gemini助手层，随时使用。你还可以将Gemini生成的图片直接拖到Gmail等应用中，直接询问某个视频中的具体信息，不用滑动翻文档询问某个PDF中的信息……

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

甚至连电话反诈，都用上Gemini了：听到关键字“把钱转到安全账号”，马上就能给出警报。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

总之，官方强调，现在，Gemini在手机上现在不止是一个App，更是安卓体验的基础。

3、谷歌Photos

谷歌Photos基于Gemini也推出了新功能——Ask Photos，可以一键从图库中帮你找到想要的照片和视频。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

比如你想知道自己的baby是什么时候学会游泳的，Ask Photos会从你在谷歌Photos中存储的成百上千张照片中查找出含游泳、游泳证书等相关图片，最后总结给出回复：

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

Ask Photos这一功能将在今年夏天推出。

4、谷歌Workspace

Gemini也接入到了谷歌Workspace提供的一套生产力和协作工具中，包括谷歌邮箱、谷歌Docs、谷歌Calendar等。

这使得在这些工具间进行跨应用工作变得更加容易。

例如在谷歌邮箱中自动分析邮件以及附件，识别整理好收据，然后一键在Drive和Sheets中处理。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

5、NotebookLM

谷歌AI笔记应用NotebookLM也大升级。

如下图所示，当你提出一个问题后，背后的Gemini模型就会结合NotebookLM中的笔记内容，进行多模态的语音对话式回答。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

也就是说，所有笔记都可以变成交互式教材。

第六代TPU

最后，在硬件部分，谷歌也带来了新消息：

第六代TPU Trillium将在今年向云客户提供。

与TPU v5e，Trillium的峰值计算性能提高4.7倍，HBM和带宽增加了1倍，芯片间互联（ICI）带宽也增加了1倍。另外，Trillium的能效比TPU v5e高出了67%以上。

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

那么今日份的发布会笔记，就先做到这里了。

你觉得谷歌这波表现如何？

从美股盘后的情况来看，似乎有点emmm……

谷歌硬刚GPT-4o！60秒视频生成模型虽迟但到，还把上下文窗口卷到了200万

Tags:

上下文模型

相关推荐

NVIDIA深度适配通义千问大模型，推出舱驾融合大模型解决方案

2024-09-20

NVIDIA深度适配通义千问大模型推出舱驾融合大模型解决方案

2024-09-20

哈啰亮相2024云栖大会：展示AI整体布局及大模型案例

2024-09-20

在线可玩！智谱开源图生视频模型，网友直呼Amazing！

2024-09-20

奥特曼：o1仅仅是“推理模型的GPT-2”；黄仁勋：我给你加速50倍

2024-09-20

免责声明: 本文所包含的观点仅代表作者个人看法，不代表新火种的观点。在新火种上获取的所有信息均不应被视为投资建议。新火种对本文可能提及或链接的任何项目不表示认可。交易和投资涉及高风险，读者在采取与本文内容相关的任何行动之前，请务必进行充分的尽职调查。最终的决策应该基于您自己的独立判断。新火种不对因依赖本文观点而产生的任何金钱损失负任何责任。

热门文章

MWC2025|华为陈海永：AI使能到AI原生，新通话构筑智能业务入口

豪掷30亿美元！OpenAI考虑收购人工智能编程工具Windsurf

2025-04-17 18:21

Manus神话破碎？邀请码炒至数万元，转头被MetaGPT成员3小时复刻

2025-04-23 11:27

全国首例保护AI模型结构判决！抖音诉B612侵害著作权获赔160万

2025-04-18 18:23

清华学霸、OpenAI姚顺雨：AI下半场开战，评估将比训练重要

2025-04-18 14:41

美国下手全面封锁！NVIDIA、AMD、Intel的AI芯片非许可禁止卖到中国

2025-04-17 18:22

1元起京东举办全国首场人形机器人拍卖：含马拉松第2名小孩哥

2025-04-21 18:21

腾讯开启史上最大就业计划，三年新增28000校招岗位，今年六成面向技术人才

2025-04-18 14:39

华为：迈向下一代光网络AION，共创AI时代新增长

2025-04-20 11:31

全球首创！阿里巴巴AI攻克“癌症之王”早筛难题获FDA最高级别认证

2025-04-18 18:23