达观杯文本智能处理挑战赛 - 代码天地

达观杯文本智能处理挑战赛

其他 2018-10-23 09:46:24 阅读次数: 0

版权声明：Geek Song创造，版权所有 https://blog.csdn.net/Geeksongs/article/details/83183360

笔者尝试了一下达观杯的比赛，代码如下图所示：

import pandas as pd

import imp

from sklearn.linear_model import LogisticRegression

from sklearn.feature_extraction.text import CountVectorizer

df_test = pd.read_csv(r'testset.csv')

df_train = pd.read_csv(r'trainset.csv')

df_train.drop(columns=['article','id'],inplace=True)

df_test.drop(columns=['article'],inplace=True)

vectorizer = CountVectorizer(ngram_range=(1, 2),min_df=3,max_df=0.9,max_features=10000)

vectorizer.fit(df_train['word_seg'])

x_train =vectorizer.transform(df_train['word_seg'])

x_test =vectorizer.transform(df_test['word_seg'])

y_train =df_train['class']-1

lg = LogisticRegression(C=4,dual=True)

lg.fit(x_train,y_train)

y_test = lg.predict(x_test)

df_test['class'] = y_test.tolist()

df_test['class'] = df_test['class'] + 1

df_result =df_test.loc[:,['id','class']]

df_result.to_csv('./result.csv',index=False)

print("完成")

运行结果是：

pandas.errors.ParserError: Error tokenizing data. C error: out of memory

这是因为我的电脑内存太小，导致了内存溢出，因此换一台电脑就可以得到最终得分为72分的答案了。笔者最终排名位于全国前300名，算是一个个人感觉还不错的成绩了。
---------------------

猜你喜欢

转载自blog.csdn.net/Geeksongs/article/details/83183360

“达观杯”文本智能处理挑战赛

达观杯文本智能处理挑战赛

“达观杯”文本智能处理挑战赛代码示例

2018“达观杯”文本智能处理挑战赛心得

“达观杯”文本智能处理挑战赛１

达观杯”文本智能处理挑战赛

sklearn文本特征提取与“达观杯”文本智能处理挑战赛

“达观杯”文本智能处理挑战赛心得体会

【数据竞赛】“达观杯”文本智能处理挑战赛２

【NLP数据竞赛】“达观杯”文本智能处理挑战赛（一）数据初识

2018年"达观杯"文本智能处理挑战赛-长文本分类-rank4解决方案

【NLP数据竞赛】“达观杯”文本智能处理挑战赛（二）word2vec词嵌入

【NLP数据竞赛】“达观杯”文本智能处理挑战赛（四）线性回归LR+支持向量机SVM

【NLP数据竞赛】“达观杯”文本智能处理挑战赛（二）TF-IDF学习笔记

达观杯文本智能信息抽取挑战赛前三名队伍分享

达观杯文本智能信息抽取挑战赛四到十名队伍分享

“达观杯”文本分类挑战赛新手入门代码

达观杯NLP挑战赛复盘

数据竞赛-“达观杯”文本智能处理-Day1

Day1—达观杯智能文本处理

达观杯文本处理（一）

数据竞赛-“达观杯”文本智能处理-Day3：word2vec实践

数据竞赛-“达观杯”文本智能处理-Day2：TF-IDF实践

数据竞赛-“达观杯”文本智能处理-Day6：模型优化

数据竞赛-“达观杯”文本智能处理-Day5：LightGBM模型

2023年认证杯数学建模网络挑战赛B题考订文本思路分析

ICPR MTWI 2018挑战赛网络图像的文本识别之数据预处理

达观杯文本处理比赛深度学习实践

达观杯文本处理比赛（二）

达观杯文本处理比赛(一)

今日推荐

富文本编辑器 Quill 2.0 重磅发布，特性、可靠性与开发者体验大幅提升

“开源信徒”周鸿祎开源360智脑大模型

周排行

Ubuntu 14.04 下Fuel6.0安装部署

香港一小巴侧翻致1死16伤警方：未见机件故障

pikachu--XSS盲打

阅读深入理解JVM虚拟机笔记一

java.sql.SQLException: ORA-00932: 数据类型不一致: 应为 -, 但却获得 CLOB

oracle delete all object under an user

[LeetCode]20 Valid Parentheses 有效的括号

树形DP求树的直径【模板】

Context propagation over HTTP in Go

【PAT】（B）1053 住房空置率 (20)*

每日归档

更多

2024-04-18(0)

2024-04-17(5)

2024-04-16(70)

2024-04-15(42)

2024-04-14(0)

2024-04-13(119)

2024-04-12(38)

2024-04-11(14)

2024-04-10(68)

2024-04-09(5)