写点什么

谷歌版贾维斯意外泄露!自主上网购物填表不在话下,“钢铁侠 ”成真指日可待?

  • 2024-11-11
    北京
  • 本文字数:2467 字

    阅读完需:约 8 分钟

大小:1.10M时长:06:26
谷歌版贾维斯意外泄露!自主上网购物填表不在话下,“钢铁侠 ”成真指日可待?

整理 | 华卫、核子可乐


一场意外泄露事件后,谷歌这位科技巨头无意之中证实了其先进人工智能“Jarvis”的存在。据了解,Jarvis 能够访问网站、在获得用户许可的情况下进行在线购物,甚至填写表格。基于 Chrome 平台的 AI,也将是这款浏览器自 2008 年推出以来规模最大的功能升级。


不久前,谷歌意外泄露了最新 AI 发展成果 Jarvis 的“内部预览版”。Jarvis 原本是《钢铁侠》电影中 Tony Stark 的人工智能助手的首字母缩写词,全称为 “Just Another Very Intelligent System”。就像《钢铁侠》电影一样,Jarvis 应该是一个代理型人工智能,即只需要很少或不需要人类输入就能执行任务的自主系统。


被泄露的文件最初被发布在谷歌自己的云平台之上,在存留期间,其内容显示谷歌打造了一款能够浏览互联网并自主检索信息的 AI 智能体。


Jarvis 或将接管 Chrome 浏览器


据外媒报道,该 AI 智能体于本周二在 Chrome 浏览器网络商店中作为扩展程序短暂提供下载,并被描述为 “与你一起上网的好伙伴”。


可惜的是,该扩展程序虽然可以下载,但需要某些用户无法绕过的访问权限。有人在该扩展程序被删除之前抢先完成了安装,但尚无法正常使用。当天晚些时候,该扩展程序已从网络商店删除。


Jarvis 无意中出现在 Chrome 浏览器网店上,证实了之前有关谷歌正在开发这一产品的报道。


10 月底,有外媒报道称,谷歌也正在开发一种可以通过简单命令来接管计算机的 AI 工具,该工具在内部被称为 Project Jarvis,能够代表用户浏览网页,并执行购买产品和预订航班等任务。


与依赖预加载数据的现有 AI 工具不同,Jarvis 能够搜索网络并为用户提供检索实时数据的能力,从而绕过传统搜索引擎。简而言之,它基本上接管了 Chrome 网络浏览器来为用户执行任务。


报道指出,该工具的工作原理是截取计算机屏幕的屏幕截图,并“在执行单击按钮或输入文本字段等操作之前对截图进行解读”,这与微软此前备受争议的 Recall 功能非常相似,尽管后者用于存储和检索用户的计算机行为(目前微软宣称该项目将“稍后”亮相,且最初只开放给 Windows Insider 计划成员)。


Jarvis 的功能似乎是谷歌 Bard AI 的延伸,可以将自然语言理解与高级数据检索功能相结合。这种向实时数据响应的转变也代表着传统聊天机器人的最新发展方向。传统聊天机器人往往受到训练数据的限制,因此只能根据特定日期之前的信息回答问题。


报道还提到出,该工具目前的反应速度有些慢,“因为模型在采取每个动作之前需要思考几秒钟”。这表明,Jarvis 可能还没有准备好进入黄金时段。当时的消息称,谷歌计划在 12 月公开推出 Jarvis,同时推出的还有最新版本的 Gemini 大型语言模型。


现在,有熟悉谷歌内情的消息人士表示,Jarvis 本打算在对外发布之前进行内部试点测试。然而,此番意外泄露让不少人猜测谷歌恐怕会提前正式发布的时间。


AI 智能体操控屏幕的未来将至


上个月,当 Anthropic 推出名为“计算机使用 ”的新功能,基本上可以接管用户的计算机来读取和编写 JavaScript 代码时,我们的认知从 “《钢铁侠》只是一部电影 ”变成了 “这正在发生”。现在,谷歌的 Jarvis AI 智能体似乎要让 “钢铁侠 ”幻想成真了。


只不过,Claude 是为程序员量身定制的,用于操作软件应用程序,而 Jarvis 与之不同,据说它是基于浏览器的,可以想象它将面向更主流的受众市场。


据外媒报道,OpenAI 也在开发这类自主 AI 智能体。此次谷歌 Jarvis AI 意外泄露事件就发生在 OpenAI o1 模型泄露的几天之后,后者同样意外曝光了一款能够分析图像、访问网络搜索结果及数据分析等工具的新推理模型,可能很快就会发展出更多的自主网页浏览功能。


几天前的 OpenAI 伦敦开发者大会上,Sam Altman 在与 20VC 创始人 Harry Stebbings 的对谈中,就对 AI 智能体进行了这样的定义:能够接受长期任务,且在执行过程中几乎不需要监督。他举例说,“假设不是让 AI 智能体给一家餐厅打电话订餐,而是让它同时联系 300 家餐厅,找出哪家最适合或者有优惠。我认为更有意思的是那种像一位聪明的资深同事一样,能与你在项目中真正协作的智能体。”


在最近的一次 Reddit AMA 中,OpenAI 首席产品官 Kevin Weil 也暗示道,ChatGPT 将首先具备向用户发送消息的能力,而为用户执行任务将是他们 “2025 年的一大主题”。


微软团队上月低调开源的 OmniParser,在 Hugging Face 上迅速大受欢迎的同时,似乎也预示着 AI 智能体操控屏幕的未来。OmniParser 是一款解析和识别屏幕布局的 AI 工具,能够提取文本、按钮和图标等重要信息,还可以将这些元素转换成结构化的数据,精准理解用户意图,可以帮助开发者自主创建用于操控电脑或手机界面的智能体。


并且,OmniParser 并不局限于网络浏览器或移动应用程序等特定的环境,它的目标是成为任何支持视觉的 LLM 与从桌面到嵌入式屏幕等各种数字界面进行交互的工具。据悉,GPT-4V 在使用 OmniParser 输出后,图标的正确标记率从 70.5% 提升至 93.8%。


此外,Apple Intelligence 也承诺通过其“屏幕感知”功能实现同样的功能。它会观察用户的活动并将发现输入到系统当中,以便下次以智能方式代替用户执行这些任务。


结   语


对谷歌来说,提高工作效率和自动化某些琐碎的任务是其许多 AI 产品寻找杀手级用例的方向。谷歌也在 Workspace 应用程序中引入了生成式 AI 功能,包括谷歌 Docs(文档)、Gmail、Sheets(表格)和 Slides(幻灯片)。


而关于此次意外泄露的“内部预览版”Jarvis,近期已有不少类似可以通过简单命令来接管计算机的 AI 智能体出现在大众视线里。需要注意的是,随着这类 AI 驱动浏览变得愈发普遍,围绕数据透明度、访问私人内容和网络数据的道德使用引发的问题也可能进一步激化。


参考链接:


https://www.theinformation.com/briefings/google-accidentally-reveals-jarvis-ai-that-takes-over-computers


https://mashable.com/article/google-accidentally-leaked-new-ai-tool-browses-internet-for-you


https://www.tomsguide.com/ai/google-confirms-jarvis-ai-after-accidental-leak-heres-what-we-know


https://www.androidpolice.com/google-gemini-project-jarvis-ai-agent/


2024-11-11 14:354517

评论

发布
暂无评论

全新F1洞察精彩亮相,帮你理解赛道上的瞬间决定!

亚马逊云科技 (Amazon Web Services)

不同数据库模式下DATE类型的行为解析

华为云开发者联盟

MySQL oracle GaussDB(DWS) TD DATE类型

Cilium 1.10 重磅发布!】支持 Wireguard, BGP, Egress IP 网关, XDP 负载均衡, 阿里云集成

公众号:云原生Serverless

云原生 cilium cni

iOS 面试策略之经验之谈-面向协议的编程

iOSer

ios swift 面试 面向协议protocol编程 面向协议编程

阿里P9架构师力荐:Java面试必刷的17套一线大厂真题(含答案)

Java架构追梦

Java 阿里巴巴 架构 腾讯 面试

iOS 面试策略之经验之谈- App的测试和上架

iOSer

ios 面试 app上架 app测试

iOS面试大全从面试的准备和流程到算法和数据结构以及计算机基础知识

iOSer

ios 面试 面向协议protocol编程 iOS 知识体系

强劲性能释放释放:联想消费新品笔记本震撼发布

E科讯

强化基于位置的4种营销策略

郑州埃文科技

IP 营销 ISP

5G掀起工业互联网浪潮,水泥厂智能管理模式收效颇丰

一只数据鲸鱼

数据可视化 工业互联网 智慧工厂 水泥厂 智能工厂

探索专有领域的端到端ASR解决之道

华为云开发者联盟

端到端 ASR 自动语音识别 语境偏移 专有领域

☕【JVM 技术之旅】攻克技术盲点之“JVM常量池们“

洛神灬殇

JVM 5月日更 字符串常量池 静态常量池 运行时常量池

屏幕共享的实现与应用

anyRTC开发者

音视频 WebRTC RTC sdk

Django 之路由篇

若尘

django Python编程 路由 5月日更

提高建模效率:自动化机器学习之贝叶斯优化综述

索信达控股

机器学习 自动化 金融科技 贝叶斯公式 产品建模

详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)

阿里云视频云

阿里云 WebRTC 3A算法 音频技术 视频云

再不解决延迟不当,小心你的内存被打爆

华为云开发者联盟

线程 延迟 内存 并发 Sleep

☕【JVM 技术之旅】深入JVM原理分析synchronized

洛神灬殇

synchronized 重量级锁 5月日更 同步锁 ObjectMontior

手把手带你体验 Amazon Graviton2 的高性价比!文末有惊喜

亚马逊云科技 (Amazon Web Services)

“零信任产业标准工作组”再度升级,持续促进国内零信任产业的协同发展

详解RS232、RS485、RS422、串口和握手

不脱发的程序猿

串口 通信总线 RS232、RS485、RS422 握手通信

iOS 面试策略之经验之谈-架构的选择

iOSer

ios 架构

一文通关苦涩难懂的Java泛型

程序猿阿星

泛型 java基础 Java泛型

打造生态“朋友圈”,英特尔以生态之道培育AI创新“大气候”

E科讯

字节、美团等客户与华为联合创新DCI智能控制器,共筑互联网基础设施新生态

驾云驭能,云科技点燃制造创新之旅!

亚马逊云科技 (Amazon Web Services)

农产品区块链溯源平台建设解决方案,健全食品安全体系

源中瑞-龙先生

区块链 溯源 食品安全

助力秋招第二弹:Java并发编程知识梳理

北游学Java

Java 面试 秋招

将模型转为NNIE框架支持的wk模型第一步:tensorflow->caffe

华为云开发者联盟

tensorflow caffe NNIE框架 wk模型 mxnet

GitHub开源的10个超棒后台管理面板

不脱发的程序猿

GitHub 开源 后台管理面板

NUCLEO-L432KC实现ADC配置(STM32L432KC)

不脱发的程序猿

嵌入式 单片机 NUCLEO-L432KC STM32L432KC 光敏电阻传感器

谷歌版贾维斯意外泄露!自主上网购物填表不在话下,“钢铁侠 ”成真指日可待?_AI&大模型_华卫_InfoQ精选文章