写点什么

评估指标

收录了 评估指标 频道下的 50 篇内容

大语言模型系统评估新框架:微观指标构建方法论
大语言模型系统评估新框架:微观指标构建方法论

文章围绕大语言模型系统评估微观指标展开。指出单一指标有局限性,应将模型视为系统的一部分进行评估。构建能预警用户问题、聚焦业务的指标体系很关键,指标需与业务目标一致且随实践优化。同时,建议采用渐进式开发模式,先搭建基础框架,再逐步完善指标体系。

让你的AI绿起来,艾伦研究所提出深度学习效率评估标准Green AI
让你的 AI 绿起来,艾伦研究所提出深度学习效率评估标准 Green AI

培养一个靠谱的AI需要消耗大量的算力。随着摩尔定律的终结,AI的计算成本正在疯长,几乎每隔几个月计算基线就要翻一番。听起来可能有点吓人,可事实就是,从2012年到2018年,AI算力消耗几乎增长了30万倍。

谷歌Metrax为JAX引入了预定义的模型评估指标
谷歌 Metrax 为 JAX 引入了预定义的模型评估指标

Metrax是一个JAX库,最近由谷歌开源,为分类、回归、自然语言处理(NLP)、视觉和音频模型提供了标准化的性能指标实现。

机器学习评估指标 AUC 综述
机器学习评估指标 AUC 综述

AUC 的什么特性让它如此受欢迎?有没有更好的指标替代 AUC?

如何评价推荐系统的结果质量?
如何评价推荐系统的结果质量?

本文是对推荐系统评测标准制定经验总结。

深度解读字节跳动的画质评估工具:抖音也在用~
深度解读字节跳动的画质评估工具:抖音也在用~

从抖音集团内部画质评估体系的建设历程着笔,主要分享画质评测对于业务的重要性、主要应用场景和内部产品的一些典型实践。

极客说|深度对比:SFT、ReFT、RHLF、RLAIF、DPO、PPO
极客说|深度对比:SFT、ReFT、RHLF、RLAIF、DPO、PPO

最近 OpenAI Day2 展示的 demo 可能把 ReFT 带火了,接下来,本文对比 SFT、ReFT、RHLF、DPO、PPO 这几种常见的技术。

不只看数字:软件开发企业如何评估客户端工程师绩效
不只看数字:软件开发企业如何评估客户端工程师绩效

本文将深入探讨可用于评估客户端工程师绩效的度量指标。

深度学习分类任务常用评估指标

​​​​摘要:这篇文章主要向大家介绍深度学习分类任务评价指标,主要内容包括基础应用、实用技巧、原理机制等方面,希望对大家有所帮助。

机器学习
深度学习
模型评价方法(一)
模型评价方法(一)

本文来自微信京东数科技术说公众号。

深度学习应用篇-推荐系统[11]:推荐系统的组成、场景转化指标(pv点击率,uv点击率,曝光点击率)、用户数据指标等评价指标详解
深度学习应用篇 - 推荐系统 [11]:推荐系统的组成、场景转化指标(pv 点击率,uv 点击率, 曝光点击率)、用户数据指标等评价指标详解

在网络技术不断发展和电子商务规模不断扩大的背景下,商品数量和种类快速增长,用户需要花费大量时间才能找到自己想买的商品,这就是信息超载问题。为了解决这个难题,个性化推荐系统(Recommender System)应运而生。

人工智能
深度学习
推荐系统
搜索推荐
6 月 优质更文活动
多标签分类中的损失函数与评价指标
多标签分类中的损失函数与评价指标

各位朋友大家好,欢迎来到月来客栈。在前面的一篇文章[1]中笔者介绍了在单标签分类问题中模型损失的度量方法,即交叉熵损失函数。同时也介绍了多分类任务中常见的评价指标及其实现方法[2]。在接下来的这篇文章中,笔者将会详细介绍在多标签分类任务中两种常见

PyTorch
多标签
多标签分类
文本分类
详解目标检测模型的评价指标及代码实现
详解目标检测模型的评价指标及代码实现

为了评价模型的泛化能力,即判断模型的好坏,我们需要用某个指标来衡量,有了评价指标,就可以对比不同模型的优劣,并通过这个指标来进一步调参优化模型。

人工智能
华为云
华为云开发者联盟
企业号 3 月 PK 榜
目标检测模型的评价标准-AP与mAP
目标检测模型的评价标准 -AP 与 mAP

为了了解模型的泛化能力,即判断模型的好坏,我们需要用某个指标来衡量,有了评价指标,就可以对比不同模型的优劣,并通过这个指标来进一步调参优化模型。对于分类和回归两类监督模型,分别有各自的评判标准。

ap
map
roc
PR曲线
精确率与召回率
中电标协提出并归口:《政务APP评价指标》团体标准开启制订工作
中电标协提出并归口:《政务 APP 评价指标》团体标准开启制订工作

由中国电子工业标准化技术协会(简称“中电标协”)提出并归口,北京博睿宏远数据科技股份有限公司作为牵头单位,联合中国电子技术标准化研究院、北京思源政通科技集团有限公司等各单位发起的“《政务APP评价指标》团体标准”,近日正式启动了标准制订工作。

App
标准化
中电标协
政务信息化
博睿宏远
AI简报-图像质量评价指标-LPIPS
AI 简报 - 图像质量评价指标 -LPIPS

如何判断两幅图相似度?

人工智能
深度学习
5月月更
机器学习算法评估指标—2D语义分割
机器学习算法评估指标—2D 语义分割

机器学习算法评估指标

学习
2D
评估标准
语义分割
机器学习算法评估指标——2D 目标跟踪
机器学习算法评估指标——2D 目标跟踪

在2D目标跟踪任务中,我们需要从精度、鲁棒性、运行速度等方面对算法进行综合评估。首先介绍单目标跟踪(SOT)算法的常用评估指标;其次介绍多目标跟踪(MOT)算法的常用评估指标。

学习
2D
评估标准
推荐系统 [四]:精排 - 详解排序算法 LTR (Learning to Rank)_ poitwise, pairwise, listwise 相关评价指标,超详细知识指南。

推荐可分为以下四个流程,分别是召回、粗排、精排以及重排: 1. 召回是源头,在某种意义上决定着整个推荐的天花板; 2. 粗排是初筛,一般不会上复杂模型; 3. 精排是整个推荐环节的重中之重,在特征和模型上都会做的比较复杂;

自然语言处理
推荐系统
搜索算法
LLM 中评价指标与训练概要介绍
LLM 中评价指标与训练概要介绍

本文会对 LLM 中评价指标预训练概要进行介绍

自动驾驶
算法工具链
地平线征程6
评估指标专题_资料-InfoQ中文网