写点什么

谷歌版贾维斯意外泄露!自主上网购物填表不在话下,“钢铁侠 ”成真指日可待?

  • 2024-11-11
    北京
  • 本文字数:2467 字

    阅读完需:约 8 分钟

大小:1.10M时长:06:26
谷歌版贾维斯意外泄露!自主上网购物填表不在话下,“钢铁侠 ”成真指日可待?

整理 | 华卫、核子可乐


一场意外泄露事件后,谷歌这位科技巨头无意之中证实了其先进人工智能“Jarvis”的存在。据了解,Jarvis 能够访问网站、在获得用户许可的情况下进行在线购物,甚至填写表格。基于 Chrome 平台的 AI,也将是这款浏览器自 2008 年推出以来规模最大的功能升级。


不久前,谷歌意外泄露了最新 AI 发展成果 Jarvis 的“内部预览版”。Jarvis 原本是《钢铁侠》电影中 Tony Stark 的人工智能助手的首字母缩写词,全称为 “Just Another Very Intelligent System”。就像《钢铁侠》电影一样,Jarvis 应该是一个代理型人工智能,即只需要很少或不需要人类输入就能执行任务的自主系统。


被泄露的文件最初被发布在谷歌自己的云平台之上,在存留期间,其内容显示谷歌打造了一款能够浏览互联网并自主检索信息的 AI 智能体。


Jarvis 或将接管 Chrome 浏览器


据外媒报道,该 AI 智能体于本周二在 Chrome 浏览器网络商店中作为扩展程序短暂提供下载,并被描述为 “与你一起上网的好伙伴”。


可惜的是,该扩展程序虽然可以下载,但需要某些用户无法绕过的访问权限。有人在该扩展程序被删除之前抢先完成了安装,但尚无法正常使用。当天晚些时候,该扩展程序已从网络商店删除。


Jarvis 无意中出现在 Chrome 浏览器网店上,证实了之前有关谷歌正在开发这一产品的报道。


10 月底,有外媒报道称,谷歌也正在开发一种可以通过简单命令来接管计算机的 AI 工具,该工具在内部被称为 Project Jarvis,能够代表用户浏览网页,并执行购买产品和预订航班等任务。


与依赖预加载数据的现有 AI 工具不同,Jarvis 能够搜索网络并为用户提供检索实时数据的能力,从而绕过传统搜索引擎。简而言之,它基本上接管了 Chrome 网络浏览器来为用户执行任务。


报道指出,该工具的工作原理是截取计算机屏幕的屏幕截图,并“在执行单击按钮或输入文本字段等操作之前对截图进行解读”,这与微软此前备受争议的 Recall 功能非常相似,尽管后者用于存储和检索用户的计算机行为(目前微软宣称该项目将“稍后”亮相,且最初只开放给 Windows Insider 计划成员)。


Jarvis 的功能似乎是谷歌 Bard AI 的延伸,可以将自然语言理解与高级数据检索功能相结合。这种向实时数据响应的转变也代表着传统聊天机器人的最新发展方向。传统聊天机器人往往受到训练数据的限制,因此只能根据特定日期之前的信息回答问题。


报道还提到出,该工具目前的反应速度有些慢,“因为模型在采取每个动作之前需要思考几秒钟”。这表明,Jarvis 可能还没有准备好进入黄金时段。当时的消息称,谷歌计划在 12 月公开推出 Jarvis,同时推出的还有最新版本的 Gemini 大型语言模型。


现在,有熟悉谷歌内情的消息人士表示,Jarvis 本打算在对外发布之前进行内部试点测试。然而,此番意外泄露让不少人猜测谷歌恐怕会提前正式发布的时间。


AI 智能体操控屏幕的未来将至


上个月,当 Anthropic 推出名为“计算机使用 ”的新功能,基本上可以接管用户的计算机来读取和编写 JavaScript 代码时,我们的认知从 “《钢铁侠》只是一部电影 ”变成了 “这正在发生”。现在,谷歌的 Jarvis AI 智能体似乎要让 “钢铁侠 ”幻想成真了。


只不过,Claude 是为程序员量身定制的,用于操作软件应用程序,而 Jarvis 与之不同,据说它是基于浏览器的,可以想象它将面向更主流的受众市场。


据外媒报道,OpenAI 也在开发这类自主 AI 智能体。此次谷歌 Jarvis AI 意外泄露事件就发生在 OpenAI o1 模型泄露的几天之后,后者同样意外曝光了一款能够分析图像、访问网络搜索结果及数据分析等工具的新推理模型,可能很快就会发展出更多的自主网页浏览功能。


几天前的 OpenAI 伦敦开发者大会上,Sam Altman 在与 20VC 创始人 Harry Stebbings 的对谈中,就对 AI 智能体进行了这样的定义:能够接受长期任务,且在执行过程中几乎不需要监督。他举例说,“假设不是让 AI 智能体给一家餐厅打电话订餐,而是让它同时联系 300 家餐厅,找出哪家最适合或者有优惠。我认为更有意思的是那种像一位聪明的资深同事一样,能与你在项目中真正协作的智能体。”


在最近的一次 Reddit AMA 中,OpenAI 首席产品官 Kevin Weil 也暗示道,ChatGPT 将首先具备向用户发送消息的能力,而为用户执行任务将是他们 “2025 年的一大主题”。


微软团队上月低调开源的 OmniParser,在 Hugging Face 上迅速大受欢迎的同时,似乎也预示着 AI 智能体操控屏幕的未来。OmniParser 是一款解析和识别屏幕布局的 AI 工具,能够提取文本、按钮和图标等重要信息,还可以将这些元素转换成结构化的数据,精准理解用户意图,可以帮助开发者自主创建用于操控电脑或手机界面的智能体。


并且,OmniParser 并不局限于网络浏览器或移动应用程序等特定的环境,它的目标是成为任何支持视觉的 LLM 与从桌面到嵌入式屏幕等各种数字界面进行交互的工具。据悉,GPT-4V 在使用 OmniParser 输出后,图标的正确标记率从 70.5% 提升至 93.8%。


此外,Apple Intelligence 也承诺通过其“屏幕感知”功能实现同样的功能。它会观察用户的活动并将发现输入到系统当中,以便下次以智能方式代替用户执行这些任务。


结   语


对谷歌来说,提高工作效率和自动化某些琐碎的任务是其许多 AI 产品寻找杀手级用例的方向。谷歌也在 Workspace 应用程序中引入了生成式 AI 功能,包括谷歌 Docs(文档)、Gmail、Sheets(表格)和 Slides(幻灯片)。


而关于此次意外泄露的“内部预览版”Jarvis,近期已有不少类似可以通过简单命令来接管计算机的 AI 智能体出现在大众视线里。需要注意的是,随着这类 AI 驱动浏览变得愈发普遍,围绕数据透明度、访问私人内容和网络数据的道德使用引发的问题也可能进一步激化。


参考链接:


https://www.theinformation.com/briefings/google-accidentally-reveals-jarvis-ai-that-takes-over-computers


https://mashable.com/article/google-accidentally-leaked-new-ai-tool-browses-internet-for-you


https://www.tomsguide.com/ai/google-confirms-jarvis-ai-after-accidental-leak-heres-what-we-know


https://www.androidpolice.com/google-gemini-project-jarvis-ai-agent/


2024-11-11 14:354743

评论

发布
暂无评论
发现更多内容

APP频繁改版惹人烦?火山引擎VeDI来帮忙

字节跳动数据平台

数字化 企业数字化 企业号 4 月 PK 榜 APP改版

干货分享|金融机构如何通过标签画像实现精细化客户运营?

索信达控股

关于FTP文件传输协议说明,带你了解更详细的文件传输协议

镭速

苹果电脑软件应用打开出现意外退出、崩溃问题解决办法

互联网搬砖工作者

NFT交易平台商城系统开发技术

薇電13242772558

NFT

精选2023年大厂高频Java面试真题集锦(含答案),面试一路开挂

程序知音

java面试 java架构 Java进阶 后端技术 Java面试八股文

MobTech ShareSDK|分享报错怎么办

MobTech袤博科技

面试还不懂Netty,看这篇文章就够了!

程序员小毕

Java 程序员 后端 Netty 架构师

阿里内部都在疯传!企业级Spring Boot 项目开发实战教程,我先肝了

程序知音

Java 微服务 springboot java架构 Java进阶

面试官:谈谈分布式一致性机制

Java永远的神

程序员 分布式 微服务 后端 架构师

一文彻底搞懂Raft算法,看这篇就够了!!!

Redis崩吗?来一起搞定 Redis 实践中的常见问题!

Steven

redis

OpenSea交易平台开发NFT系统部署技术

薇電13242772558

NFT

携多款产品亮相“深圳先进制造业集群展”,华秋积极探索发展机遇

华秋电子

四种常见服务限流算法解析

EMQ&阿里云Lindorm联合方案:解决物联网关键业务场景数据处理难题

EMQ映云科技

阿里云 物联网 IoT 数据处理 企业号 4 月 PK 榜

GOPS 全球运维大会来了,龙蜥社区邀您一起了解“系统运维”

OpenAnolis小助手

开源 操作系统 内核 龙蜥社区 GOPS全球运维大会

新旧版本功能对比 | v1.5.0 全新升级

BinTools图尔兹

数据库 社区版 版本更新

华秋PCB生产工艺分享 | 第十一道之成型

华秋电子

快手基于 Apache Flink 的实时数仓建设实践

Apache Flink

大数据 flink 实时计算

漫谈 ChatGPT 与问答式 BI

观远数据

数据分析 BI ChatGPT

【福利】ChatGPT免费体验期延长,商用版正式开启预约!

BeeWorks

EasyMR 安全架构揭秘:如何管理 Hadoop 数据安全

袋鼠云数栈

大数据

选择低代码,帮企业数字化转型提交一份满分答卷

加入高科技仿生人

软件开发 低代码 数字化 数字转型

现在学C4D还是Blender好?这俩有啥区别?

Finovy Cloud

blender C4D

详解 Flink Catalog 在 ChunJun 中的实践之路

袋鼠云数栈

flink

5 大手段,打造单一可信源代码托管平台|极狐GitLab DevSecOps 助力 SLSA 落地之源代码篇

极狐GitLab

DevOps DevSecOps 源代码 安全审计 SLSA

行业盛会丨九科信息亮相第十一届中国电子信息博览会(CITE2023),与您共享科技盛宴

九科Ninetech

PCB拼版对SMT组装的影响,华秋一文告诉你

华秋电子

谷歌版贾维斯意外泄露!自主上网购物填表不在话下,“钢铁侠 ”成真指日可待?_AI&大模型_华卫_InfoQ精选文章