写点什么
创作场景
- 记录自己日常工作的实践、心得
- 发表对生活和职场的感悟
- 针对感兴趣的事件发表随笔或者杂谈
- 从 0 到 1 详细介绍你掌握的一门语言、一个技术,或者一个兴趣、爱好
- 或者,就直接把你的个人博客、公众号直接搬到这里
登录/注册
收录了 模型评估 频道下的 50 篇内容

如何使用TF-Hub库对预训练模型进行微调?

今天,我们非常高兴地推出 Amazon SageMaker Processing,这是Amazon SageMaker 的一项新功能

Hugging Face 发布检索嵌入基准框架 RTEB,旨在更准确地衡量嵌入模型在真实检索场景下的泛化能力。

Metrax是一个JAX库,最近由谷歌开源,为分类、回归、自然语言处理(NLP)、视觉和音频模型提供了标准化的性能指标实现。

随着对大语言模型(LLM)评估领域的深入研究,我们更加清楚地认识到全面理解评估过程中的问题对于有效评估LLM至关重要。 本文探讨了机器学习模型评估中出现的常见问题,并深入研究了LLM对模型评估领域带来的重大挑战。在评估方法方面,我们将其划分为直接评

随着大模型 Agent 从实验原型迈向核心业务生产,工程化的重心正经历从“验证可行性”向“追求确定性”的本质跃迁。Agent 的本质是“自主”、“涌现”、“不可预测”——这些词本身就和“确定性”对着干。但企业要的是什么?是可用、是可靠、是出了事能找到原因、是敢把核心业务交给它。那么,一个本质上不确定的系统,我们能把它变得足够“确定”吗?如果能,靠什么?可观测性在这个命题里,扮演的是什么角色?
"这个模型比那个强"——这句话在AI 圈天天说,但怎么证明?靠感觉不行,要靠系统评估。大模型评估是门学问,做不好评估,就做不好模型选择与应用决策。本文系统讲解大模型评估的维度、方法与陷阱。
阿里云人工智能平台 PAI 推出 PAI-Judge 裁判员大模型,为用户构建符合应用场景的多维度、细粒度的评测体系,支持单模型评测和双模型竞技两种模式,允许用户自定义参数,实现准确、灵活、高效的模型自动化评测,为模型迭代优化提供数据支撑。

在通用能力、专用场景能力应用成熟度三个能力域上均获优异结果。

在AI飞速进化的今天,两个看似传统的方法正成为大模型评估的关键密钥:监督微调(SFT)与评分规则评估(rubric-based evaluation)。它们如同教育的两面——一个耐心教导模型如何回应,一个精准评判模型的表现优劣。Old Is New Again?一起走进本期AppenTalk

DeepSeek 开源推动医疗智能化,多家医院已部署相关技术。大型语言模型在医疗领域潜力大,但传统评估方式有局限。 MedHELM 应运而生,经科学构建流程评估不同规模模型,发现其各有优劣。目前评估面临挑战,后续将持续优化,它有望推动医疗行业智能化升级。
根据我们之前在Precision处的分析,其实可以看得出来,当样本均衡过后,假正率会更高,因为有更多紫色点被判断错误,而样本均衡之前,假正率比

Hugging Face推出了Community Evals功能,使Hub上的基准测试数据集能够托管自己的排行榜,并自动从模型存储库中收集评估结果。

导语:本文是模型评估指标系列的第一篇,将详细地介绍分类模型中基于混淆矩阵衍生出来的各个指标的计算公式,如准确率,精确率,召回率,FPR,TPR,ROC曲线的绘制逻辑,AUC的计算公. 本文首发在个人知乎和微信公众号:一直学习一直爽

Dropbox 工程师开始采用大语言模型辅助人工标注,这一做法在识别用于生成回复的文档方面发挥了关键作用。

7月13日,奇富科技正式开源面向业务场景的自动建模Agent——ModelEvo。这一工具既是为了将分散的专家经验沉淀为标准化、可复用的建模能力,提升内部研发效率,同时也希望将经过真实业务验证的方法论开放给行业,参与到AI建模基础设施的共建中。

有效衡量基于大语言模型(LLM)的应用性能,已经成为企业采用 AI 技术的关键因素。来自红帽团队的 Legare Kerrison 与 Cedric Clyburn 近日在 Arc of AI 2026 大会上分享了评估与优化 LLM 推理的实用方法。他们讨论了 RAG(检索增强生成)与 Agentic AI 等 AI 应用中不同工作负载的资源需求与成本影响,同时强调了 Requests Per Second(RPS)、Time to First Token(TTFT)以及 Inter-Token Latency(ITL)等指标在应用评估中的重要性。

“下一名受害者不会总是Hugging Face。”

本文介绍了在真实环境中评估 AI 智能体的实用方法,阐述了如何结合基准测试、自动化评估流程与人工评审来衡量智能体的可靠性、任务完成度及多步行为表现。文章还探讨了对具备规划、工具调用及多轮交互能力的系统进行评估所面临的挑战。

短视频信息流产品是目前最炙手可热的互联网产品,完全占领了用户的碎片时间,据艾瑞统计2018年短视频产品月独立设备数有6亿+台。