2天时间,聊今年最热的 Agent、上下文工程、AI 产品创新等话题。2025 年最后一场~ 了解详情
写点什么

钉钉 AI 震撼升级:加入多模态、工作流等能力

  • 2024-03-28
    北京
  • 本文字数:1724 字

    阅读完需:约 6 分钟

钉钉AI震撼升级:加入多模态、工作流等能力

3 月 28 日,钉钉 AI 助理重磅升级,上线图片理解、文档速读、工作流等产品能力,率先探索多模态、长文本与 RPA 技术在 AI 应用的落地。


基于阿里通义千问大模型,升级后的钉钉 AI 助理拥有更强的视觉推理能力和长文本速读能力。目前,用户在钉钉 IM 消息框或点击魔法棒按钮进入 AI 助理对话框,发送长文件、在线文档、网页链接、视频内容,即可根据内容识人、识地点、分析、答题、翻译、摘要、提取文字,甚至可以通过多轮交互进一步做智能问答。


钉钉 AI 已支持图像理解、视频速读,化身全能“小百科”


LLM(大语言模型)之后,大模型领域迎来了新的爆点“多模态”,为 AI 应用带来了更大的想象力。


基于通义千问 Qwen-VL-Max 视觉理解模型,钉钉 AI 助理能够准确描述和识别图片信息,并根据图片进行信息推理、扩展创作、文字提取、翻译等,相当于一个全能的“图片小百科”。




不管图片展示的是某件物体、某个人物、风景,还是菜谱、社交梗图、数学题和衣服标签,AI 助理都能一秒识别图片内容,并在此基础上进行多轮对话问答。比如,旅游时看到一个很美的建筑,拍照发给钉钉 AI 助理,就能迅速了解它的历史背景和相关故事。


利用这一能力,用户还可以实现识图翻译或提取图片中的文字,让信息获取更加便捷。比如,不知道某件衣服的洗涤方式,把衣服标签拍个照发给钉钉 AI 助理,就可以翻译上面的英文。


通义千问 Qwen-VL-Max 拥有更强的视觉推理和中文理解能力,整体性能堪比 GPT-4V 和 Gemini Ultra。在 MMMU、MathVista 等测评中远超业界所有开源模型,在文档分析(DocVQA)、中文图像相关(MM-Bench-CN)等任务上超越 GPT-4V,达到世界最佳水平。




此外,AI 助理也支持视频内容的速读。发送给 AI 助理的短视频、直播切片或培训视频可以被快速“观看”, AI 助理会根据视频内容生成字幕,提取关键词,并生成一份智能摘要,对于最高 2GB 的视频内容,仅需 3 分钟即可完成智能解读。


“文档速读”能力升级,从冗长信息中解放生产力


利用大模型技术从文本中检索、总结信息,可以说是每个人日常生活、工作、学习的需求场景。


基于通义千问大模型,钉钉 AI 助理可以快速阅读本地文件如 Word、PDF、PPT、Excel 等、钉钉文档、网页链接等多种格式文件,轻松解析各类学术论文、产品手册、使用教程、数据表格、新闻报道、多国语言的图书等。




比如,临时需要分析一个业务数据时,上传相关的 Excel 表格,AI 助理就可以直接给出数据结论;企业复杂的产品手册发送给 AI 助理后,可以快速总结和智能问答,大幅提升信息效率。


值得一提的是,钉钉 AI 助理对长文本的处理能力已支持单次阅读 500 页的文件,可以为法律、医学、金融等专业领域提供更全面、准确的信息服务。


比如,有研究者将一份《大模型与自动驾驶如何结合研究报告》的长论文发送后,AI 助理在几秒内就快速总结了相应的内容,并给出了这一研究具体是什么、研究的技术创新点、研究方法等诸多论文的关键要素。用户还可以进一步追问某个知识点的具体来源或相关信息,从阅览文档、反复检索的冗长工作中彻底解放。


AI 助理上线“工作流”, AI 也能干复杂的活了


随着 OpenAI 带火 Agent(智能体),大模型融入自动化技术成为当前最具共识的方向之一。


今年 1 月,钉钉 AI 助理正式上线,企业和个人 AI 助理已进入到工作和生产力场景中。为让 AI 助理可以完成一系列更复杂的任务,钉钉 AI 助理上线了工作流能力。


工作流是 AI Agent 的一种进阶玩法,不仅可以在创建时对 AI 执行任务的流程进行拆解和编排,使得 AI 助理可以主动接管完成相应操作,还能够打通外部的系统数据和 API 能力,进一步扩展了它的行动能力,比如搭建能自动写脚本并生成视频的创作 AI 助理。




为降低用户的使用门槛,钉钉官方还提供了多种工作流模板。已有企业使用工作流创建了门店信息收集助理,将用户反馈自动化整理,并存储到一张钉钉多维表中,帮助员工节约琐碎的时间;个人用户也通过连接微博 API,创建了自动追踪热点并撰写文章的助理,一个指令就能批量执行,大幅提升内容生产的效率。


目前,用户可在钉钉 APP 或 PC 客户端直接使用 AI 助理的各项功能,包括多模态、长文本和工作流,体验 AI 带来的便捷与高效。


关于以上内容的更多信息,钉钉 CTO 程操红将在 4 月 11 日 QCon 全球软件开发大会上进行更深度地讲解,敬请关注!



2024-03-28 12:266554
用户头像
鲁冬雪 GMI Cloud Head of China Marketing

发布了 381 篇内容, 共 330.0 次阅读, 收获喜欢 304 次。

关注

评论

发布
暂无评论
发现更多内容

与紧张为友,享受紧张

宇宙之一粟

读书笔记 个人成长 演讲 9月月更 享受紧张

mysql查询 limit 1000,10 和limit 10 速度一样快吗?如果我要分页,我该怎么办?

Java快了!

MySQL

lodash 在vue3+vite中按需加载

木叶🐱

vite Vue3 lodash

蓝凌OA

科技云未来

用过这个API接口工具后,确实感觉postman有点鸡肋......

Liam

Java Postman swagger API开发 API调式

「工作小记」关于业务组件的思考

叶一一

前端 React 组件开发 9月月更

验证一个小小的问题

艾小仙

Java MySQL 编程 程序员 compact

WAIC 2022 | 洞见科技在可信AI论坛联合发布《可信人工智能产业生态发展报告》

洞见科技

无代码开发平台怎么选?选择合适无代码平台的13个关键步骤

优秀

无代码平台

WAIC 2022 | 洞见科技王湾湾出席BPAA第二届应用算法实践典范,共话前沿算法产业发展

洞见科技

前端食堂技术周刊第 51 期:pnpm v7.10.0、8 月登陆网络平台的新内容、重新思考流行的 Node.js 模式和工具、打包 JavaScript 库的现代化指南

童欧巴

chrome Node React Chrome开发者工具 pnpm

java基础学习:java中的反射

Java快了!

java;

面向对象分析与设计的底层逻辑

阿里巴巴中间件

阿里云 云原生

Java 并发编程解析 | 如何正确理解Java领域中的锁机制,我们一般需要掌握哪些理论知识?

Java快了!

Java并发 java;

Dragonfly 基于 P2P 的文件和镜像分发系统

SOFAStack

容器 云原生 镜像 日志 文件

ShareSDK Android端主流平台分享示例

MobTech袤博科技

an'droid

由循环开始的前端学习杂谈话事录-sam9029

Sam9029

前端 个人博客 成长笔记 9月月更

ShareSDK iOS端微信如何获取authcode值

MobTech袤博科技

微信 iOS SDK

MobLink后台基本配置

MobTech袤博科技

android 开发者 iOS SDK

使用 CRD 开启您的 Ingress 可观测之路

观测云

观测云&亚马逊云科技「可观测性体验日」北京站圆满落幕

观测云

对jdbc的讲解

楠羽

JDBC 笔记 9月月更

「工作小记」小程序开发的喜怒哀乐

叶一一

小程序 前端 9月月更

五分钟了解 Databend 全新 SQL 类型系统

Databend

开源项目 sql 开源社区 SQL分析

Dubbo Mesh:从服务框架到统一服务控制平台

阿里巴巴中间件

阿里云 微服务 云原生 dubbo

2022服贸会 | 洞见科技姚明:从智能化到密态化,数据科技向善升级

洞见科技

设计模式的艺术 第七章原型设计模式练习(在某销售管理系统中设计并实现了一个客户类Customer,其中包含一个名为客户地址的成员变量,客户地址的类型为Address。用浅克隆和深克隆分别实现Customer对象的复制)

代廉洁

设计模式的艺术

Koordinator 0.6:企业级容器调度系统解决方案,引入 CPU 精细编排、资源预留与全新的重调度框架

阿里巴巴中间件

阿里云 云原生 Koordinator

钉钉AI震撼升级:加入多模态、工作流等能力_AI&大模型_钉钉_InfoQ精选文章