写点什么

如何构建高质量数据集与进行公正模型评测,AICon 带你一探究竟

  • 2024-07-08
    北京
  • 本文字数:1724 字

    阅读完需:约 6 分钟

如何构建高质量数据集与进行公正模型评测,AICon 带你一探究竟

AI 大模型超全落地场景&金融应用实践,8 月 16 - 19 日 FCon x AICon 大会联诀来袭、干货翻倍!

高质量的数据集对于大模型的性能至关重要。获取这样的数据集需要经过精心的数据收集、清洗、标注、增强和平衡处理。同时,数据安全和隐私保护也是不可忽视的环节。大模型的评测同样重要,它包括准确性、鲁棒性、泛化能力、效率、可解释性以及伦理和偏见的考量。


AICon 全球人工智能开发与应用大会针对这些关键议题,策划了【数据集构建以及评测】论坛。这个论坛将聚焦于数据集的构建策略、模型的评测方法,以及如何确保模型的公平性和透明度。目前已经有几个精彩的议题

精彩推荐议题一:


如果有一个分享,可以带你了解全栈式行业数据处理和模型训练的方法,那你应该听听!


近年来,闭源大语言模型(LLMs)和开源社区在通用领域取得了显著进展,甚至在某些方面超越了人类。然而,在医学、政务等专业领域,语言模型的表现仍然不足。面对决这些挑战,智源研究院通过行业合作伙伴联合实验室机制,基于行业数据集构造和示范模型训练实践,提出了数据集构建技术体系,以及包含持续预训练、监督微调(SFT)以及强化学习(RLHF)技术的完整行业模型训练范式,获得了良好的模型性能效果。


我们非常荣幸邀请到北京智源人工智能研究院大模型行业应用总监周华老师,在本次演讲中,他将首先介绍人工智能大模型在行业落地的发展趋势,并分析当前面临的主要问题。随后,他会分享智源研究院在推动大模型行业落地方面的工作思路和研究方向。接着,他将详细讲解行业数据集构建的范式,以及行业模型训练的有效方法。在演讲的实践案例部分,周华将依次分享两个案例:首先是 Aquila-Med 示范模型的数据集构建和模型训练经验,其次是 Aquila-SQL 模型的训练过程及其在实际应用中的表现。


通过他的分享,你可以了解到企业内部大模型构建的方法、行业大模型训练的技术经验以及数据处理的方法和技术体系。

精彩推荐议题二:


如过有一个演讲,能带你了解了解多模态评测相关进展,那不能错过,尤其还是北京大学二级教授张铭的分享。


现有的数据集主要集中在检验模型解决专家级别难题的能力上,难以反映模型在基础知识方面的掌握情况。由于缺乏和人类表现相关的数据,因此科学家也不可能获取到更具实际意义的模型表现参考。为了攻克这些局限性,张铭团队构建了首个多模态 STEM 数据集,并且在此基础上实现对大语言模型与多模态基础模型的评测。评测的结果发现,即使是目前最先进的人工智能模型,其 STEM 基础水平也存在较大的提升空间,尚不具备解决更有难度的现实问题的能力。


此外,张铭团队还提出了一个新的社会学科数据集 Social,包含较大规模的文本评估数据,可用来评测大语言模型的社会学科基础能力;团队还设计了一种多智能体交互的方法,能够增强大语言模型在 Social 数据集上的表现。


我们非常有幸邀请到北京大学二级教授张铭,为我们分享《全方位评测神经网络模型的基础能力》话题,通过她的分享你可以了解到多模态评测相关进展探索以及大语言模型通用智能体方法进展探索。


精彩推荐议题三:


如果有一个演讲能够带你了解掌握幻觉评估的新方法、探索出模型幻觉原因与解决方案,那错过智源的分享就太可惜了。


大型语言模型 (LLMs) 在各种任务中取得了卓越的性能, 并在现实世界中得到了广泛应用。然而,LLMs 容易出现幻觉, 生成与已知知识相冲突或不忠实于原始信息来源的内容,影响了 LLMs 在很过高厉害场景上的应用。


现有的幻觉基准主要关注句子或段落层面的幻觉检测, 忽略了对话层面的评估、幻觉定位和原因解析。为了缓解现有幻觉评估的局限性, 智源提出了 HalluDial, 第一个全面的大规模自动对话级幻觉评估基准。


利用 HalluDial, 智源对 LLMs 在信息搜索对话中的幻觉评估能力进行了全面的元评估, 并引入了一个专门的判断语言模型 HalluJudge。HalluDial 的高数据质量使 HalluJudge 在幻觉评估中取得了优异或有竞争力的性能, 有助于自动评估 LLMs 中的对话级幻觉。


我们非常也有幸邀请到智源研究院智能评测组负责人杨熙 她将分享《大语言模型的幻觉检测》话题,为你提供不一样的幻觉解决思路。



活动推荐:


InfoQ 将于 8 月 18 日至 19 日在上海举办 AICon 全球人工智能开发与应用大会,汇聚顶尖企业专家,深入端侧 AI、大模型训练、安全实践、RAG 应用、多模态创新等前沿话题。现在大会已开始正式报名,详情可联系票务经理 13269078023 咨询。



公众号推荐:

AIGC 技术正以惊人的速度重塑着创新的边界,InfoQ 首期《大模型领航者AIGC实践案例集锦》电子书,深度对话 30 位国内顶尖大模型专家,洞悉大模型技术前沿与未来趋势,精选 10 余个行业一线实践案例,全面展示大模型在多个垂直行业的应用成果,同时,揭秘全球热门大模型效果,为创业者、开发者提供决策支持和选型参考。关注「AI前线」,回复「领航者」免费获取电子书。

2024-07-08 19:144309

评论

发布
暂无评论

MyBatis Plus 批量数据插入功能,yyds!

王磊

mybatis springboot

模块4作业

4anonymous

千万级学生管理系统的考试试卷存储方案

Sky

架构训练营

设计千万级学生管理系统的考试试卷存储方案

Yina🌝很浪🌊

从浏览器地址栏输入url到显示页面的步骤

Augus

浏览器 9月日更

陌陌和它的解药,聊聊出海社交产品的思路

拍乐云Pano

社交APP出海 社交APP 泛娱乐出海

消息队列:Kafka Consumer源码解读

正向成长

kafka

时间转换不在变bug

卢卡多多

时间戳 时间转换 9月日更

架构实战营-模块四作业

南山先生

「架构实战营」

Base64编码对照表

入门小站

工具

J2PaaS低代码开源版,10月1号即将上线,企业数字化转型优选!

J2PaaS低代码平台

低代码 零代码 开发工具

阿里资深架构师整理分享全套Java核心技术面试题及答案

Java 编程 架构 面试 程序人生

模塊九 畢業設計

孫影

架构实战营 #架构实战营

linux之软连接和硬连接的区别

入门小站

Linux

千万级学生管理系统的考试试卷存储方案

毛先生

网络攻防学习笔记 Day148

穿过生命散发芬芳

等级保护 9月日更

阿里藏经阁天花板:高性能Java架构核心原理手册,一定要偷偷看

Java 编程 架构 面试 程序人生

26. 自动驾驶的六个级别

数据与智能

人工智能

java 虚拟机 GC 学习笔记三

风翱

GC 9月日更

Prometheus 2.28.0 新特性

耳东@Erdong

Prometheus 9月日更 relaese

2021西部云安全峰会召开:“云安全优才计划”发布,腾讯云安全攻防矩阵亮相

腾讯安全云鼎实验室

云安全 峰会

连锁便利店:夕阳产业还是明日之星

石头IT视角

WebRTC是如何设置视频编码偏好的?

liuzhen007

音视频 引航计划 领航计划

2021年金九银十必问的1000道Java面试题及答案整理

Java 架构 面试 程序人生 编程语言

被阿里奉为神册!2021公认最权威的分布式微服务指导手册

Java 架构 面试 程序人生 编程语言

架构实战营 设计千万级学生管理系统的考试试卷存储方案

💤 ZZzz💤

架构实战营

深耕与构建:华为数字能源的立体版图

脑极体

阿里IM技术分享(四):闲鱼亿级IM消息系统的可靠投递优化实践

JackJiang

架构设计 即时通讯 IM

喜讯 | 拍乐云创始人赵加雨荣获「2021企业数智化转型升级先锋人物」奖

拍乐云Pano

音视频 数智化

阿里大牛再写传奇:并发原理JDK源码手册GitHub下载量已破百万

Java 编程 架构 面试 程序人生

如何设计高可用高性能架构

眼镜盒子

架构实战营

如何构建高质量数据集与进行公正模型评测,AICon 带你一探究竟_AI&大模型_李忠良_InfoQ精选文章