写点什么
创作场景
- 记录自己日常工作的实践、心得
- 发表对生活和职场的感悟
- 针对感兴趣的事件发表随笔或者杂谈
- 从 0 到 1 详细介绍你掌握的一门语言、一个技术,或者一个兴趣、爱好
- 或者,就直接把你的个人博客、公众号直接搬到这里
登录/注册
收录了 文本数据 频道下的 50 篇内容
以统计理论为基础,利用机器学习算法对已知的训练数据做统计分析从而获得规律,再运用规律对未知数据做预测分析,已成为文本分类领域的主流。InfoQ联合“达观数据“共同策划了《文本大数据的机器学习自动分类方法》系列文章,为您详细阐述机器学习文本分类的基本方法与处理流程。
以统计理论为基础,利用机器学习算法对已知的训练数据做统计分析从而获得规律,再运用规律对未知数据做预测分析,已成为文本分类领域的主流。InfoQ联合“达观数据“共同策划了《文本数据的机器学习自动分类方法》系列文章,为您详细阐述机器学习文本分类的基本方法与处理流程。
这篇文章中,我们将介绍如何使用Scikit-learn来实现用于机器学习的文本数据准备。文章主要介绍了三个Scikit-learn自带的文本数据量化工具——CountVectorizer、TfidfVectorizer和HashingVectorizer。

Hugging Face发布了FineTranslations,这是一个大规模多语言数据集,包含覆盖英语和其他500多种语言的并行文本、超过1万亿个Token。

怎样才能拥有足够多且可供深度学习模型训练用的数据呢?

LLMs)在处理和生成自然语言方面取得了一定的进步,但这些模型处理文本的长度有限,在理解和生成长文本方面的能力也受到影响。

我们重新设计了 ClickHouse 全文索引 (full-text index),使其能够在 对象存储 (object storage) 上高效运行。 新的布局 (layout) 倾向于 顺序访问 (sequential access),并且无需读取被索引的文本列,即可直接从索引中响应大量查询。本文将深入探讨这一新设计,内容由负责构建该设计的工程师们撰写。
我们采集或导出的原始文本数据中,通常包含着大量无关的emoji和url信息,面对大量的无用信息时该怎么办?少量数据通常我们可采用人工剔除的方式,但在数据量较大的情况下,往往就无从下手。
在当今信息爆炸的时代,文本数据的分析变得尤为重要。而Elasticsearch作为一款强大的搜索和分析引擎,提供了丰富的功能和工具,使得对文本数据进行深度分析变得更加便捷和高效。本文将介绍如何利用Elasticsearch进行文本数据的深度分析,探索其在各种应用场景
在日常生活中,我们经常面临各种问题和需求,而智能问答系统作为一种人机交互工具,为我们提供了便捷的问题解答和信息获取方式。而问答对话文本数据作为推动智能问答系统发展的关键资源,扮演着重要角色。
在当今数字化时代,文本数据已成为人类活动的主要载体,无处不在的信息交流塑造着我们的社会、经济和文化。而正是这些海量的文本数据,为大型模型的训练和应用提供了丰富的资源,成为其重要的基石与洞察力之源。
在人工智能领域的发展中,问答对话系统显得尤为重要。一方面,它为我们提供了常用的人机交互方式;另一方面,它也对互联网公司和其他机构提供了一种新的商业模式。不过,对话系统的核心技术之一就是问答对话文本数据的处理,它直接决定对话系统的准确性和可用
对话文本数据,作为人类交流的生动表现,正成为训练大型模型的宝贵资源。这些数据不仅蕴含了丰富的语言特点和人类交流方式,更在模型训练中发挥着重要的意义,从而为其赋予更强大的智能和更自然的交流能力。
自然语言理解(Natural Language Understanding,简称NLU)问答对话文本数据是现代人工智能领域的一项重要资源。这些数据集涵盖了用户与计算机之间的自然语言交互,旨在让计算机能够理解和回答用户的问题、执行任务以及进行情感识别等多样化的交流。本文将深
在当今信息爆炸的时代,对话文本数据正成为塑造人工智能大模型的重要基石,为这些模型注入智能和情感理解的能力。这些数据不仅在培养模型的语言表达能力方面起到关键作用,更为其赋予了人类交流的深度和多样性。

ModelWhale 将编程建模、模型训练、数据&算力管理等功能深度整合,通过逐级开放的基础设施,与 Jupyter Notebook 交互式、Canvas 低代码拖拽式、CloudIDE 三种即开即用的云分析环境,为研究者团队解决数据安全应用、底层工程繁复、研究成果流转困难等问题。

![恒源云(GPUSHARE)_[文本分类] 文本数据增强1(论文笔记)](https://static001.geekbang.org/infoq/ca/ca23e9d60df78388e7df3bfd5bf867df.png?x-oss-process=image/resize,w_416,h_234)

本案例详细介绍如何在云主机部署DeepSeek-r1:1.5b模型,内容主要包括云主机安装ollama,并通过ollama部署DeepSeek-r1:1.5b模型,以及云主机安装CherryStudio,并基于DeepSeek+CherryStudio配置“数据分析师”实现文本数据表格化处理与数据分析。
