亚洲激情专区-91九色丨porny丨老师-久久久久久久女国产乱让韩-国产精品午夜小视频观看

溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

如何進行K均值算法K-Means的案例分析

發布時間:2021-12-10 11:25:24 來源:億速云 閱讀:216 作者:柒染 欄目:大數據

今天就跟大家聊聊有關如何進行K均值算法K-Means的案例分析,可能很多人都不太了解,為了讓大家更加了解,小編給大家總結了以下內容,希望大家根據這篇文章可以有所收獲。

背景介紹

這是一種無監督算法,可以解決聚類問題。它的過程遵循一種簡單的方法,可以通過一定數量的聚類(假設k個聚類)對給定的數據集進行分類。集群中的數據點對同級組是同質的,并且是異構的。

還記得從墨水印跡中找出形狀嗎? k表示此活動有點類似。 您查看形狀并展開以解釋存在多少個不同的群集/種群!

如何進行K均值算法K-Means的案例分析


K-均值如何形成聚類:

  1. K均值為每個群集選取k個點,稱為質心。

  2. 每個數據點形成具有最接近質心的群集,即k個群集。

  3. 根據現有集群成員查找每個集群的質心。在這里,我們有了新的質心。

  4. 當我們有了新的質心時,請重復步驟2和3。找到每個數據點與新質心的最近距離,并與新的k簇相關聯。重復此過程,直到會聚發生為止,即質心不變。


如何確定K的值:

在K均值中,我們有聚類,每個聚類都有自己的質心。 質心和群集中數據點之間的差平方和構成該群集的平方值之和。 同樣,當所有聚類的平方和相加時,它成為聚類解的平方和之內的總和。

我們知道,隨著簇數的增加,該值會不斷減少,但是如果繪制結果,您可能會看到平方距離的總和急劇減小,直到達到某個k值,然后才逐漸減小。 在這里,我們可以找到最佳的群集數量。

如何進行K均值算法K-Means的案例分析

下面來看使用Python實現的案例:

'''The following code is for the K-MeansCreated by - ANALYTICS VIDHYA'''
# importing required librariesimport pandas as pdfrom sklearn.cluster import KMeans
# read the train and test datasettrain_data = pd.read_csv('train-data.csv')test_data = pd.read_csv('test-data.csv')
# shape of the datasetprint('Shape of training data :',train_data.shape)print('Shape of testing data :',test_data.shape)
# Now, we need to divide the training data into differernt clusters# and predict in which cluster a particular data point belongs.  
'''Create the object of the K-Means modelYou can also add other parameters and test your code hereSome parameters are : n_clusters and max_iterDocumentation of sklearn KMeans:
https://scikit-learn.org/stable/modules/generated/sklearn.cluster.KMeans.html '''
model = KMeans()  
# fit the model with the training datamodel.fit(train_data)
# Number of Clustersprint('\nDefault number of Clusters : ',model.n_clusters)
# predict the clusters on the train datasetpredict_train = model.predict(train_data)print('\nCLusters on train data',predict_train)
# predict the target on the test datasetpredict_test = model.predict(test_data)print('Clusters on test data',predict_test)
# Now, we will train a model with n_cluster = 3model_n3 = KMeans(n_clusters=3)
# fit the model with the training datamodel_n3.fit(train_data)
# Number of Clustersprint('\nNumber of Clusters : ',model_n3.n_clusters)
# predict the clusters on the train datasetpredict_train_3 = model_n3.predict(train_data)print('\nCLusters on train data',predict_train_3)
# predict the target on the test datasetpredict_test_3 = model_n3.predict(test_data)print('Clusters on test data',predict_test_3)
 

運行結果:

Shape of training data : (100, 5)Shape of testing data : (100, 5)
Default number of Clusters :  8
CLusters on train data [6 7 0 7 6 5 5 7 7 3 1 1 3 0 7 1 0 4 5 6 4 3 3 0 4 0 1 1 0 3 4 3 3 0 0 1 2 1 4 3 0 2 1 1 0 3 3 0 7 1 3 0 5 1 0 1 5 4 6 4 3 6 5 0 3 0 4 33 1 5 1 6 5 7 7 6 3 5 3 5 3 1 5 2 5 0 3 2 3 4 7 1 0 1 5 3 6 1 6]Clusters on test data [3 6 2 0 5 6 0 3 5 2 3 4 5 5 5 3 3 5 5 70 0 5 5 3 5 0 6 5 0 1 6 3 5 6 0 1 7 3 0 0 6 2 0 5 3 5 7 3 3 4 6 3 1 6 3 1 3 3 2 3 3 5 1 7 5 1 53 3 5 2 0 1 5 0 3 0 3 6 3 5 4 0 2 6 3 5 6 0 6 4 3 5 0 6 6 6 1 0]
Number of Clusters :  3
CLusters on train data [2 0 1 0 2 1 2 0 0 2 0 0 2 1 0 0 1 2 2 2 2 2 2 1 2 1 0 0 1 2 2 2 2 1 1 0 2 0 2 2 1 2 0 0 1 2 2 1 0 0 2 1 2 0 1 0 2 2 2 2 2 2 2 1 2 1 2 22 0 1 0 2 2 0 0 0 2 0 2 2 2 0 2 2 2 1 2 2 2 2 0 0 1 0 2 2 2 0 2]Clusters on test data [2 2 2 1 2 2 1 2 2 2 2 2 2 1 1 2 2 2 2 01 1 2 2 2 2 1 2 2 1 0 2 2 2 2 1 0 0 2 1 1 2 2 1 2 2 2 0 2 2 2 2 2 0 2 2 0 2 2 2 2 2 2 0 0 2 0 22 2 0 2 1 0 2 1 2 1 2 0 2 2 2 1 2 2 2 2 2 1 2 2 2 2 1 2 2 2 0 1]

看完上述內容,你們對如何進行K均值算法K-Means的案例分析有進一步的了解嗎?如果還想了解更多知識或者相關內容,請關注億速云行業資訊頻道,感謝大家的支持。

向AI問一下細節

免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

AI

民勤县| 泗洪县| 双鸭山市| 沅陵县| 清远市| 山东省| 临邑县| 肇州县| 西贡区| 宜城市| 阿合奇县| 资溪县| 西藏| 沂源县| 庄浪县| 沁水县| 龙州县| 天津市| 青阳县| 漳平市| 陆良县| 苏尼特左旗| 那坡县| 宁明县| 甘泉县| 台中县| 江口县| 常德市| 获嘉县| 卓资县| 新乐市| 万山特区| 沾益县| 大余县| 淄博市| 盐城市| 两当县| 苍山县| 洱源县| 阜阳市| 万宁市|