NLP之新闻文本分类——Task1 - 代码天地

NLP之新闻文本分类——Task1

其他 2020-10-14 16:37:04 阅读次数: 0

NLP入门实践——新闻文本分类

Task1——赛题理解

1.学习目标
理解赛题背景与赛题数据
完成赛题报名和数据下载，理解赛题的解题思路

2.赛题数据
赛题以匿名处理后的新闻数据为赛题数据，数据集报名后可见并可下载。赛题数据为新闻文本，并按照字符级别进行匿名处理。整合划分出14个候选分类类别：财经、彩票、房产、股票、家居、教育、科技、社会、时尚、时政、体育、星座、游戏、娱乐的文本数据。

3.赛题规模
赛题数据由以下几个部分构成：训练集20w条样本，测试集A包括5w条样本，测试集B包括5w条样本。为了预防选手人工标注测试集的情况，我们将比赛数据的文本按照字符级别进行了匿名处理。

4.数据标签
在数据集中标签的对应的关系如下：{‘科技’: 0, ‘股票’: 1, ‘体育’: 2, ‘娱乐’: 3, ‘时政’: 4, ‘社会’: 5, ‘教育’: 6, ‘财经’: 7, ‘家居’: 8, ‘游戏’: 9, ‘房产’: 10, ‘时尚’: 11, ‘彩票’: 12, ‘星座’: 13}

5.评测指标
评价标准为类别f1_score的均值，选手提交结果与实际测试集的类别进行对比，结果越大越好。

6.解题思路
赛题思路分析：赛题本质是一个文本分类问题，需要根据每句的字符进行分类。但赛题给出的数据是匿名化的，不能直接使用中文分词等操作，这个是赛题的难点。

因此本次赛题的难点是需要对匿名字符进行建模，进而完成文本分类的过程。由于文本数据是一种典型的非结构化数据，因此可能涉及到特征提取和分类模型两个部分。有以下几种思路：

思路1：TF-IDF + 机器学习分类器
直接使用TF-IDF对文本提取特征，并使用分类器进行分类。在分类器的选择上，可以使用SVM、LR、或者XGBoost。

思路2：FastText
FastText是入门款的词向量，利用Facebook提供的FastText工具，可以快速构建出分类器。

思路3：WordVec + 深度学习分类器
WordVec是进阶款的词向量，并通过构建深度学习分类完成分类。深度学习分类的网络结构可以选择TextCNN、TextRNN或者BiLSTM。

思路4：Bert词向量
Bert是高配款的词向量，具有强大的建模学习能力。

猜你喜欢

转载自blog.csdn.net/DZZ18803835618/article/details/107486360

NLP之新闻文本分类——Task1

Task1：影评文本分类

NLP之新闻文本分类——Task2

NLP之新闻文本分类——Task5

NLP之新闻文本分类——Task4

NLP之新闻文本分类——Task4

NLP之新闻文本分类——Task6

NLP之新闻文本分类——Task5

NLP之新闻文本分类——Task3

NLP之新闻文本分类——Task3

NLP——天池新闻文本分类 TASK3

零基础入门NLP之新闻文本分类_Task2

原创零基础入门NLP之新闻文本分类_Task6

零基础入门NLP之新闻文本分类_Task5

零基础入门NLP之新闻文本分类_Task4

零基础入门NLP之新闻文本分类_Task3

零基础入门NLP之新闻文本分类

阿里天池文本分类竞赛task1: 赛题理解

NLP——天池新闻文本分类 Task4：fasttext深度学习

Datawhale-零基础入门NLP-新闻文本分类Task06

Datawhale-零基础入门NLP-新闻文本分类Task02

Datawhale-零基础入门NLP-新闻文本分类Task01

Datawhale-零基础入门NLP-新闻文本分类Task05

Datawhale-零基础入门NLP-新闻文本分类Task04

Datawhale-零基础入门NLP-新闻文本分类Task03

NLP之文本分类

天池NLP赛事-新闻文本分类（四）——基于深度学习的文本分类1-FastText

【nlp】天池学习赛-新闻文本分类-深度学习1

NLP实践（新闻文本分类）-赛题理解及思路

【nlp】天池学习赛-新闻文本分类-机器学习

今日推荐

基于大语言模型的开源知识库问答系统 MaxKB GitHub Star 数量突破 5,000 个！

美国拟限制 AI 大模型出口中国和俄罗斯

苹果将与 OpenAI 达成协议，将 ChatGPT 应用于 iPhone

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

报告：Django 仍然是 74% 开发者的首选

《2024 年一季度互联网投融资运行情况》研究报告

15 年前上了“FFmpeg 耻辱柱”，今天他还得谢谢咱——腾讯QQPlayer一雪前耻？

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

周排行

BPM为企业带来的实际利益

好程序员web前端分享css常用属性缩写

Java文件下载（excel）

css样式的动态添加及显示和隐藏等零碎用法

axios全局配置以及拦截器

使用Logstash来实时同步MySQL和log日志数据到ES

C++获取当前时间（年月日、时分秒、毫秒）

Odoo产品分析 (四) -- 工具板块(11) -- 网站即时聊天(1)

Java环境配置正确，但是java、javac、java -version均返回“不是内部或外部命令，也不是可运行的程序或批处理文件”？

01 官网下载各种CentOS教程（超详细版）

每日归档

更多

2024-05-14(0)

2024-05-13(18)

2024-05-12(0)

2024-05-11(38)

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)