Mark a mistake(一) - 代码天地

Mark a mistake(一)

其他 2018-07-27 14:10:28 阅读次数: 0

today,when I use sklearn's KMeans algorithm to fit my trainingset , meet some mistake..

there is my code...

import numpy as np
import pandas as pd
import matplotlib.pyplot as plt
import seaborn as sns
from sklearn.cluster import KMeans
from sklearn import linear_model
import csv
import os

file = pd.read_excel(io="D://influence.xlsx",encoding='UTF-8',sheet_name= 'movie_metadata')

print(file.head())

#对影响电影的所有特征进行统计与分析(数量，去重数，最高，最高出现次数，平均值，最小等多组特征进行分析)
file_data = file.describe(include = 'all').T
print(file_data)

#分别从原数据集中读取电影名name1，以及由票房数和IMDB评分构成的dataframe--data1
name1 = pd.read_excel(io="D://influence.xlsx",encoding='UTF-8',sheet_name= 'movie_metadata',usecols=[0,19])
data1 = pd.read_excel(io="D://influence.xlsx",encoding='UTF-8',sheet_name= 'movie_metadata',usecols=[19,25])

#数据清洗，去除dataframe中为NaN的行(为了不影响之后的聚类分析)
data2 = data1.dropna(axis=0)
name2 = name1.dropna(axis=0)
print(data2)
print(name2)
name = name1['电影名']

#创建KMeans对象，进行初始化参数设定
km = KMeans(n_clusters=3)
label = km.fit_predict(data2)

print(label)
category = np.sum(km.cluster_centers_,axis=1)

print(category)
print(sum(label))

MoviesCluster = [[],[],[]]
for i in range(len(name)):
    MoviesCluster(label[i].append(name[i]))
for i in range(len(MoviesCluster)):
    print("Category：%.2f" % category[i])
    print(MoviesCluster[i])

Error:

I want affect like this:

猜你喜欢

转载自blog.csdn.net/weixin_40896352/article/details/80863303

Mark a mistake(一)

Mark一下

mark 一下

DBeaver （mark一把）

Mark一下~

mark

Mark一些书签

【Mark学Java】 Collection(一)

【Mark学Java】JavaScript(一)

mistake

FFT详解-【Mark一下】

sqlload日语介绍，mark一下

几何版子mark一下

mark一下需要记住的

mark一下最近的规划

mark一下岗位

mark一下最近发生的事

新申请的博客，MARK一下

Mark一下开始的日子。

开通博客了，mark一下

mark一下咕掉的题目

Mark学Java之 Collection(一)

Mark学Java 之JavaScript(一)

【Mark学算法】排序算法(一)

【mark】CSDN博客访问突破50万，MARK一下

大年初一mark一下

一款markdown文档编辑神器 mark text

MARK：一个Sqrt函数引发的血案

m2eclipse插件地址，mark一下

Mark一下共轭转置矩阵

今日推荐

开源日报 | Chrome内置Gemini的意义不在于Gemini；中国AI追随之路的五大误区；ECharts创始人“下海”养鱼；谷歌I/O开发者大会什么都有，只是没有惊喜

微软回应中国区AI团队“打包赴美”传闻

基于大语言模型的开源知识库问答系统 MaxKB GitHub Star 数量突破 5,000 个！

美国拟限制 AI 大模型出口中国和俄罗斯

苹果将与 OpenAI 达成协议，将 ChatGPT 应用于 iPhone

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

《2024 年一季度互联网投融资运行情况》研究报告

报告：Django 仍然是 74% 开发者的首选

周排行

laravle中orm简单的增删改查

文本分类特征选取之CHI开方检验

Spark核心编程-WordCount

大数据开发实战系列之电信客服(1)

读书笔记 - 把时间当作朋友 by 李笑来

python 笔记--if else

SpringBoot/Mybatis/Druid, 多数据源MultiDataSource配置思路

排序三个整数

redis集群搭建【2】-Windows中Redis集群搭建

STM32F030驱动TM1650点亮4联数码管

每日归档

更多

2024-05-16(6)

2024-05-15(24)

2024-05-14(0)

2024-05-13(18)

2024-05-12(0)

2024-05-11(38)

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)