写点什么

如何构建高质量数据集与进行公正模型评测,AICon 带你一探究竟

  • 2024-07-08
    北京
  • 本文字数:1724 字

    阅读完需:约 6 分钟

如何构建高质量数据集与进行公正模型评测,AICon 带你一探究竟

高质量的数据集对于大模型的性能至关重要。获取这样的数据集需要经过精心的数据收集、清洗、标注、增强和平衡处理。同时,数据安全和隐私保护也是不可忽视的环节。大模型的评测同样重要,它包括准确性、鲁棒性、泛化能力、效率、可解释性以及伦理和偏见的考量。


AICon 全球人工智能开发与应用大会针对这些关键议题,策划了【数据集构建以及评测】论坛。这个论坛将聚焦于数据集的构建策略、模型的评测方法,以及如何确保模型的公平性和透明度。目前已经有几个精彩的议题

精彩推荐议题一:


如果有一个分享,可以带你了解全栈式行业数据处理和模型训练的方法,那你应该听听!


近年来,闭源大语言模型(LLMs)和开源社区在通用领域取得了显著进展,甚至在某些方面超越了人类。然而,在医学、政务等专业领域,语言模型的表现仍然不足。面对决这些挑战,智源研究院通过行业合作伙伴联合实验室机制,基于行业数据集构造和示范模型训练实践,提出了数据集构建技术体系,以及包含持续预训练、监督微调(SFT)以及强化学习(RLHF)技术的完整行业模型训练范式,获得了良好的模型性能效果。


我们非常荣幸邀请到北京智源人工智能研究院大模型行业应用总监周华老师,在本次演讲中,他将首先介绍人工智能大模型在行业落地的发展趋势,并分析当前面临的主要问题。随后,他会分享智源研究院在推动大模型行业落地方面的工作思路和研究方向。接着,他将详细讲解行业数据集构建的范式,以及行业模型训练的有效方法。在演讲的实践案例部分,周华将依次分享两个案例:首先是 Aquila-Med 示范模型的数据集构建和模型训练经验,其次是 Aquila-SQL 模型的训练过程及其在实际应用中的表现。


通过他的分享,你可以了解到企业内部大模型构建的方法、行业大模型训练的技术经验以及数据处理的方法和技术体系。

精彩推荐议题二:


如过有一个演讲,能带你了解了解多模态评测相关进展,那不能错过,尤其还是北京大学二级教授张铭的分享。


现有的数据集主要集中在检验模型解决专家级别难题的能力上,难以反映模型在基础知识方面的掌握情况。由于缺乏和人类表现相关的数据,因此科学家也不可能获取到更具实际意义的模型表现参考。为了攻克这些局限性,张铭团队构建了首个多模态 STEM 数据集,并且在此基础上实现对大语言模型与多模态基础模型的评测。评测的结果发现,即使是目前最先进的人工智能模型,其 STEM 基础水平也存在较大的提升空间,尚不具备解决更有难度的现实问题的能力。


此外,张铭团队还提出了一个新的社会学科数据集 Social,包含较大规模的文本评估数据,可用来评测大语言模型的社会学科基础能力;团队还设计了一种多智能体交互的方法,能够增强大语言模型在 Social 数据集上的表现。


我们非常有幸邀请到北京大学二级教授张铭,为我们分享《全方位评测神经网络模型的基础能力》话题,通过她的分享你可以了解到多模态评测相关进展探索以及大语言模型通用智能体方法进展探索。


精彩推荐议题三:


如果有一个演讲能够带你了解掌握幻觉评估的新方法、探索出模型幻觉原因与解决方案,那错过智源的分享就太可惜了。


大型语言模型 (LLMs) 在各种任务中取得了卓越的性能, 并在现实世界中得到了广泛应用。然而,LLMs 容易出现幻觉, 生成与已知知识相冲突或不忠实于原始信息来源的内容,影响了 LLMs 在很过高厉害场景上的应用。


现有的幻觉基准主要关注句子或段落层面的幻觉检测, 忽略了对话层面的评估、幻觉定位和原因解析。为了缓解现有幻觉评估的局限性, 智源提出了 HalluDial, 第一个全面的大规模自动对话级幻觉评估基准。


利用 HalluDial, 智源对 LLMs 在信息搜索对话中的幻觉评估能力进行了全面的元评估, 并引入了一个专门的判断语言模型 HalluJudge。HalluDial 的高数据质量使 HalluJudge 在幻觉评估中取得了优异或有竞争力的性能, 有助于自动评估 LLMs 中的对话级幻觉。


我们非常也有幸邀请到智源研究院智能评测组负责人杨熙 她将分享《大语言模型的幻觉检测》话题,为你提供不一样的幻觉解决思路。



活动推荐:


InfoQ 将于 8 月 18 日至 19 日在上海举办 AICon 全球人工智能开发与应用大会,汇聚顶尖企业专家,深入端侧 AI、大模型训练、安全实践、RAG 应用、多模态创新等前沿话题。现在大会已开始正式报名,详情可联系票务经理 13269078023 咨询。



2024-07-08 19:146561

评论

发布
暂无评论
发现更多内容

鉴释人物 | 专访产品开发总监吴翔:DevSecOps的竞技之道

鉴释

敏捷开发 应用安全 软件安全 软件质量与安全

我们该如何应对日益增长的安全债务风险?

鉴释

应用安全 代码安全

我们三岁啦!

鉴释

性能测试误差对比研究(一)

FunTester

性能测试 接口测试 测试框架 误差分析

百度前端三面面试题全部公开,三面的最后一个问题令我窒息

前端依依

百度 面试 大前端 经验总结

创业邦专访丨兼容国内外市场的代码分析软件,鉴释科技帮助企业减少bug发生率

鉴释

创业公司

如何使用 Kind 快速创建 K8s 集群?

尔达Erda

开源 云原生 k8s PaaS kind

如何利用FL Studio中文版做出失真效果

懒得勤快

提升源代码安全管控,从源头保护敏感数据

鉴释

数据安全

认识容器,我们从它的历史开始聊起

华为云开发者联盟

Docker Kubernetes 容器 进程

鉴释人物丨专访首席科学家李隆: 重一步业务逻辑验证,省百步漏洞补缺

鉴释

业务逻辑 漏洞修复

CloudQuery 如何实现云上数据导入导出

BinTools图尔兹

数据库 dba 国产数据库 运维开发

揭秘百度微服务监控:百度游戏服务监控的演进

百度开发者中心

云计算 微服务 最佳实践 方法论 云原生

51CTO专访|鉴释首席架构师刘新铭:让软件开发更安全、更高效

鉴释

编译器

直播回顾丨鉴释首席架构师刘新铭为您解读“第一性原则”

鉴释

软件开发 代码质量 软件质量与安全

六种主要服务器管理协议简单概述-行云管家

行云管家

行云管家 服务器协议 服务器管理

鉴释×RT-Thread丨2020 RT-Thread开发者大会精彩回顾

鉴释

操作系统 物联网

图灵奖得主Judea Pearl谈机器学习:不能只靠数据

百度开发者中心

机器学习 最佳实践 方法论 文化 & 方法 其他

RTC月度小报5月丨教育aPaaS灵动课堂升级、抢先体验VUE版 Agora Web SDK、声网Agora与HTC达成合作

声网

月度小报 行业深度

架构实战训练营模块三课后作业

Clarke

2021全国人工智能师资培训走进北理工,百度飞桨助力高校教师提升AI能力

百度大脑

人工智能 高校

性能测试误差对比研究(二)

FunTester

性能测试 压测 接口测试 测试框架 误差分析

fil价格今日行情?2021年fil币预估价格多少钱一枚?

区块链 分布式存储 IPFS fil价格 fil预测

第八周作业——知识星球内容管理功能

小夏

产品经理训练营 邱岳

鉴释人物丨专访首席技术官陈新中:三十年磨一“鉴”, 打造静态代码分析行业标杆

鉴释

编译器 静态代码分析

Linkflow签约未卡VETRESKA,精细化运营赋能品牌成功破圈,开启种草新模式

Linkflow

即时通信 IM 产品怎么选? 本文超详细解说,马住!

腾讯云音视频

鉴释×中科院计算所丨OS2ATC 2020精彩回顾

鉴释

开源 操作系统

C/C++Linux服务器开发高级架构师/Linux后台开发架构师丨高级进阶

Linux服务器开发

架构师 Linux服务器开发 Linux后台开发 后台开发架构师 服务器开发架构师

论工作几年深陷业务代码的程序员如何实现自我提升

北游学Java

Java 程序人生

工程师文化落地的几点思考

baiyutang

敏捷 敏捷开发 精益开发 精益思想 敏捷管理

如何构建高质量数据集与进行公正模型评测,AICon 带你一探究竟_AI&大模型_李忠良_InfoQ精选文章