写点什么
创作场景
- 记录自己日常工作的实践、心得
- 发表对生活和职场的感悟
- 针对感兴趣的事件发表随笔或者杂谈
- 从 0 到 1 详细介绍你掌握的一门语言、一个技术,或者一个兴趣、爱好
- 或者,就直接把你的个人博客、公众号直接搬到这里
登录/注册
收录了 模态测试 频道下的 50 篇内容

近年来人工智能的发展,已经从“大炼模型”逐步迈向了“炼大模型”的阶段。
本文档聚焦AI多模态综合能力基准测试,针对当前主流大模型文本、图像、音频、跨模态理解与生成能力,设计标准化测试方案、评测指标与实战测试代码。旨在解决多模态模型评测无统一标准、主观测评偏差大、能力维度覆盖不全的问题,为模型效果校验、版本迭代对比
AI多模态能力指模型对文本、图像、音频等不同类型输入信息进行理解、推理、生成与跨模态转换的综合能力。多模态综合能力基准测试用于量化评估大模型在图文理解、跨模态检索、多模态生成、多轮混合输入场景下的实际表现,定位模型能力短板,为模型迭代、选型、
在AI测试领域,随着多模态大模型(MLLM)的广泛应用,如何高效进行模型对比评测成为测试工程师面临的新挑战。本文将深入探讨构建多模态模型对比评测功能的技术实现路径,分享实战经验与设计思考。

多模态能力已经成为主流模型的标配,但聚合平台在处理图片请求时的“隐性损耗”却很少被认真测试过。一张发票照片从客户端上传,经过聚合网关转发到模型API,中间可能经历Base64编解码、图片压缩、格式转换、大小限制校验等环节。每一步都可能引入延迟增加、
知识图谱是一种用图结构(Nodes-Entities & Edges-Relationships)表达现实世界关系的技术,在测试领域可理解为软件系统的"神经网络图谱"
随着大模型、RAG知识库、Agent智能体和AI Coding工具逐步进入企业研发流程,越来越多的软件测试从业者和计算机相关专业在校生开始关注人工智能测试、AI测试开发和大模型应用评测。
当知识图谱遇见测试智能体,当RAG技术重塑用例生成范式,一场颠覆传统质量保障体系的革命正在发生7月26日,西安吉源国际酒店,测试人社区主办的AITC人工智能测试开发峰会以“智测未来”为主题,汇聚涂鸦智能、恒生电子、美的集团等头部企业技术领袖。峰会现场
近年来,人工智能技术迅猛发展,AI产品已广泛应用于金融、医疗、电商、工业等领域。作为测试从业者,如何有效测试AI产品?本文将从基本概念、核心维度、实战案例、工具推荐及未来趋势五个方面,带你全面掌握AI测试方法论。
在AI技术日新月异的今天,如何有效评测大模型性能成为测试工程师面临的新挑战。本文将带您深入探索构建AI测试平台的实战过程,分享多模态模型评测的关键技术与设计思路。
当多模态大模型开始具备“看图理解界面”的能力之后,很多人就在想:
当GPT-5开始理解物理世界运行规律,当Sora生成的视频通过图灵测试,当自动驾驶事故率首次低于人类驾驶员...2025年的AI技术正在挑战质量保障的终极命题:如何为持续进化的智能系统建立可信赖的质量护城河?

当模型能力发生代际提升时,架构师的首要工作不是评估新功能如何接入,而是重新审视现有系统边界的有效性。Claude 4.8在多模态维度上的升级——图文联合推理准确率从78.5%跃升至91.2%,跨模态数值抽取错误率从9.2%压缩至3.5%——表面上是在改善已有能力,但从
在新闻应用迭代过程中,自动化测试是保障质量的关键。HarmonyOS的Test Kit提供了完整的测试框架,我们利用它构建了新闻核心功能的自动化测试体系。以下是核心实现代码段(基于HarmonyOS 4.0):

亿级淘宝视频背后的多模态AI算法揭秘

预训练权重和推理代码完全开源。
前两天聊DeepSeek视觉模型的时候,有个问题我觉得特别适合拿出来单独说。
前两天聊DeepSeek视觉模型的时候,有个问题我觉得特别适合拿出来单独说。