写点什么

模型评估

收录了 模型评估 频道下的 50 篇内容

TensorFlow工程实战(一):用TF-Hub库微调模型评估人物年龄
TensorFlow 工程实战(一):用 TF-Hub 库微调模型评估人物年龄

如何使用TF-Hub库对预训练模型进行微调?

Amazon SageMaker Processing – 完全托管的数据处理和模型评估
Amazon SageMaker Processing – 完全托管的数据处理和模型评估

今天,我们非常高兴地推出 Amazon SageMaker Processing,这是Amazon SageMaker 的一项新功能

Hugging Face 推出全新检索模型评估基准框架 RTEB
Hugging Face 推出全新检索模型评估基准框架 RTEB

Hugging Face 发布检索嵌入基准框架 RTEB,旨在更准确地衡量嵌入模型在真实检索场景下的泛化能力。

谷歌Metrax为JAX引入了预定义的模型评估指标
谷歌 Metrax 为 JAX 引入了预定义的模型评估指标

Metrax是一个JAX库,最近由谷歌开源,为分类、回归、自然语言处理(NLP)、视觉和音频模型提供了标准化的性能指标实现。

大语言模型评估全解:评估流程、评估方法及常见问题
大语言模型评估全解:评估流程、评估方法及常见问题

随着对大语言模型(LLM)评估领域的深入研究,我们更加清楚地认识到全面理解评估过程中的问题对于有效评估LLM至关重要。 本文探讨了机器学习模型评估中出现的常见问题,并深入研究了LLM对模型评估领域带来的重大挑战。在评估方法方面,我们将其划分为直接评

人工智能
白海科技
LLMOps
大模型评估
企业号 7 月 PK 榜
告别“语义黑盒”:当 Agent 走进生产环境,我们如何驯服它的“不可预测”?
告别“语义黑盒”:当 Agent 走进生产环境,我们如何驯服它的“不可预测”?

随着大模型 Agent 从实验原型迈向核心业务生产,工程化的重心正经历从“验证可行性”向“追求确定性”的本质跃迁。Agent 的本质是“自主”、“涌现”、“不可预测”——这些词本身就和“确定性”对着干。但企业要的是什么?是可用、是可靠、是出了事能找到原因、是敢把核心业务交给它。那么,一个本质上不确定的系统,我们能把它变得足够“确定”吗?如果能,靠什么?可观测性在这个命题里,扮演的是什么角色?

大模型评估体系:从 Benchmark 到对齐评测

"这个模型比那个强"——这句话在AI 圈天天说,但怎么证明?靠感觉不行,要靠系统评估。大模型评估是门学问,做不好评估,就做不好模型选择与应用决策。本文系统讲解大模型评估的维度、方法与陷阱。

月更
如何用大模型评估大模型——PAI-Judge 裁判员大语言模型的实现简介

阿里云人工智能平台 PAI 推出 PAI-Judge 裁判员大模型,为用户构建符合应用场景的多维度、细粒度的评测体系,支持单模型评测和双模型竞技两种模式,允许用户自定义参数,实现准确、灵活、高效的模型自动化评测,为模型迭代优化提供数据支撑。

人工智能
大模型
LLM
PAI
模型评测
首批!华为云盘古研发大模型通过代码大模型评估,获当前最高等级
首批!华为云盘古研发大模型通过代码大模型评估,获当前最高等级

在通用能力、专用场景能力应用成熟度三个能力域上均获优异结果。

人工智能
华为云
华为云开发者联盟
华为云盘古大模型
企业号2024年6月PK榜
评分规则+微调:大模型评估的「黄金组合」
评分规则 + 微调:大模型评估的「黄金组合」

在AI飞速进化的今天,两个看似传统的方法正成为大模型评估的关键密钥:监督微调(SFT)与评分规则评估(rubric-based evaluation)。它们如同教育的两面——一个耐心教导模型如何回应,一个精准评判模型的表现优劣。Old Is New Again?一起走进本期AppenTalk

微调
SFT
DeepSeek浪潮下,MedHELM 如何重塑AI医疗大模型评估?
DeepSeek 浪潮下,MedHELM 如何重塑 AI 医疗大模型评估?

DeepSeek 开源推动医疗智能化,多家医院已部署相关技术。大型语言模型在医疗领域潜力大,但传统评估方式有局限。 MedHELM 应运而生,经科学构建流程评估不同规模模型,发现其各有优劣。目前评估面临挑战,后续将持续优化,它有望推动医疗行业智能化升级。

AI医疗
大模型评估
医疗大模型
DeepSeek
Medhelm
支持向量机 -SVC 的模型评估指标

根据我们之前在Precision处的分析,其实可以看得出来,当样本均衡过后,假正率会更高,因为有更多紫色点被判断错误,而样本均衡之前,假正率比

Python
机器学习
算法
sklearn
11月月更
Hugging Face推出Community Evals功能,促进模型测试透明化
Hugging Face 推出 Community Evals 功能,促进模型测试透明化

Hugging Face推出了Community Evals功能,使Hub上的基准测试数据集能够托管自己的排行榜,并自动从模型存储库中收集评估结果。

模型评估指标-1-基础篇-FPR/TPR/F1/ROC/AUC
模型评估指标 -1- 基础篇 -FPR/TPR/F1/ROC/AUC

导语:本文是模型评估指标系列的第一篇,将详细地介绍分类模型中基于混淆矩阵衍生出来的各个指标的计算公式,如准确率,精确率,召回率,FPR,TPR,ROC曲线的绘制逻辑,AUC的计算公. 本文首发在个人知乎和微信公众号:一直学习一直爽

机器学习
模型评估
分类模型
一直学习一直爽
规模化人工判断:Dropbox 如何借助大语言模型优化 RAG 系统标注
规模化人工判断:Dropbox 如何借助大语言模型优化 RAG 系统标注

Dropbox 工程师开始采用大语言模型辅助人工标注,这一做法在识别用于生成回复的文档方面发挥了关键作用。

奇富科技正式开源ModelEvo 以自动建模能力参与行业基础建设
奇富科技正式开源 ModelEvo 以自动建模能力参与行业基础建设

7月13日,奇富科技正式开源面向业务场景的自动建模Agent——ModelEvo。这一工具既是为了将分散的专家经验沉淀为标准化、可复用的建模能力,提升内部研发效率,同时也希望将经过真实业务验证的方法论开放给行业,参与到AI建模基础设施的共建中。

Legare Kerrison 与 Cedric Clyburn 谈 LLM 性能与评估
Legare Kerrison 与 Cedric Clyburn 谈 LLM 性能与评估

有效衡量基于大语言模型(LLM)的应用性能,已经成为企业采用 AI 技术的关键因素。来自红帽团队的 Legare Kerrison 与 Cedric Clyburn 近日在 Arc of AI 2026 大会上分享了评估与优化 LLM 推理的实用方法。他们讨论了 RAG(检索增强生成)与 Agentic AI 等 AI 应用中不同工作负载的资源需求与成本影响,同时强调了 Requests Per Second(RPS)、Time to First Token(TTFT)以及 Inter-Token Latency(ITL)等指标在应用评估中的重要性。

AI 智能体实践评估:基准、框架与经验总结
AI 智能体实践评估:基准、框架与经验总结

本文介绍了在真实环境中评估 AI 智能体的实用方法,阐述了如何结合基准测试、自动化评估流程与人工评审来衡量智能体的可靠性、任务完成度及多步行为表现。文章还探讨了对具备规划、工具调用及多轮交互能力的系统进行评估所面临的挑战。

爱奇艺短视频质量评估模型
爱奇艺短视频质量评估模型

短视频信息流产品是目前最炙手可热的互联网产品,完全占领了用户的碎片时间,据艾瑞统计2018年短视频产品月独立设备数有6亿+台。

模型评估专题_资料-InfoQ中文网