写点什么
创作场景
- 记录自己日常工作的实践、心得
- 发表对生活和职场的感悟
- 针对感兴趣的事件发表随笔或者杂谈
- 从 0 到 1 详细介绍你掌握的一门语言、一个技术,或者一个兴趣、爱好
- 或者,就直接把你的个人博客、公众号直接搬到这里
登录/注册
收录了 评估指标 频道下的 50 篇内容

文章围绕大语言模型系统评估微观指标展开。指出单一指标有局限性,应将模型视为系统的一部分进行评估。构建能预警用户问题、聚焦业务的指标体系很关键,指标需与业务目标一致且随实践优化。同时,建议采用渐进式开发模式,先搭建基础框架,再逐步完善指标体系。

培养一个靠谱的AI需要消耗大量的算力。随着摩尔定律的终结,AI的计算成本正在疯长,几乎每隔几个月计算基线就要翻一番。听起来可能有点吓人,可事实就是,从2012年到2018年,AI算力消耗几乎增长了30万倍。

Metrax是一个JAX库,最近由谷歌开源,为分类、回归、自然语言处理(NLP)、视觉和音频模型提供了标准化的性能指标实现。

AUC 的什么特性让它如此受欢迎?有没有更好的指标替代 AUC?

本文是对推荐系统评测标准制定经验总结。

从抖音集团内部画质评估体系的建设历程着笔,主要分享画质评测对于业务的重要性、主要应用场景和内部产品的一些典型实践。

最近 OpenAI Day2 展示的 demo 可能把 ReFT 带火了,接下来,本文对比 SFT、ReFT、RHLF、DPO、PPO 这几种常见的技术。

本文将深入探讨可用于评估客户端工程师绩效的度量指标。

本文来自微信京东数科技术说公众号。
![深度学习应用篇-推荐系统[11]:推荐系统的组成、场景转化指标(pv点击率,uv点击率,曝光点击率)、用户数据指标等评价指标详解](https://static001.geekbang.org/infoq/ef/ef22d6fa64cd85f515d3620961ba0c34.jpeg?x-oss-process=image/resize,w_416,h_234)
在网络技术不断发展和电子商务规模不断扩大的背景下,商品数量和种类快速增长,用户需要花费大量时间才能找到自己想买的商品,这就是信息超载问题。为了解决这个难题,个性化推荐系统(Recommender System)应运而生。

各位朋友大家好,欢迎来到月来客栈。在前面的一篇文章[1]中笔者介绍了在单标签分类问题中模型损失的度量方法,即交叉熵损失函数。同时也介绍了多分类任务中常见的评价指标及其实现方法[2]。在接下来的这篇文章中,笔者将会详细介绍在多标签分类任务中两种常见

为了评价模型的泛化能力,即判断模型的好坏,我们需要用某个指标来衡量,有了评价指标,就可以对比不同模型的优劣,并通过这个指标来进一步调参优化模型。

为了了解模型的泛化能力,即判断模型的好坏,我们需要用某个指标来衡量,有了评价指标,就可以对比不同模型的优劣,并通过这个指标来进一步调参优化模型。对于分类和回归两类监督模型,分别有各自的评判标准。

由中国电子工业标准化技术协会(简称“中电标协”)提出并归口,北京博睿宏远数据科技股份有限公司作为牵头单位,联合中国电子技术标准化研究院、北京思源政通科技集团有限公司等各单位发起的“《政务APP评价指标》团体标准”,近日正式启动了标准制订工作。



在2D目标跟踪任务中,我们需要从精度、鲁棒性、运行速度等方面对算法进行综合评估。首先介绍单目标跟踪(SOT)算法的常用评估指标;其次介绍多目标跟踪(MOT)算法的常用评估指标。
推荐可分为以下四个流程,分别是召回、粗排、精排以及重排: 1. 召回是源头,在某种意义上决定着整个推荐的天花板; 2. 粗排是初筛,一般不会上复杂模型; 3. 精排是整个推荐环节的重中之重,在特征和模型上都会做的比较复杂;
