数据科学（机器学习:k-近邻算法）

k-近邻法简介

k近邻法(k-nearest neighbor, k-NN)是1967年由Cover T和Hart P提出的一种基本分类与回归方法。它的工作原理是：存在一个样本数据集合，也称作为训练样本集，并且样本集中每个数据都存在标签，即我们知道样本集中每一个数据与所属分类的对应关系。输入没有标签的新数据后，将新的数据的每个特征与样本集中数据对应的特征进行比较，然后算法提取样本相似数据(近邻)的分类标签。一般来说，我们只选择样本数据集中前k个相似的数据，这就是k-近邻算法中k的出处，通常k是不大于20的整数。最后，选择k个相似数据中出现次数多的分类，作为新数据的分类。

每部电影的打斗镜头、接吻镜头和电影类型

电影打斗镜头数为49，接吻镜头数为51

人的判断 k-近邻算法的判断

电影分类

k-近邻算法用距离进行度量

两点之间的距离公式

(101,20)->动作片(108,5)的距离约为16.55
(101,20)->动作片(115,8)的距离约为18.44
(101,20)->爱情片(5,89)的距离约为118.22
(101,20)->爱情片(1,101)的距离约为128.69

圆点标记的电影到动作片 (108,5)的距离近，为16.55。如果算法直接根据这个结果，判断该圆点标记的电影为动作片，这个算法就是近邻算法，而非k-近邻算法。

k-近邻算法步骤如下：

计算已知类别数据集中的点与当前点之间的距离；

按照距离递增次序排序；

选取与当前点距离小的k个点；

确定前k个点所在类别的出现频率；

返回前k个点所出现频率高的类别作为当前点的预测分类。

比如，现在我这个k值取3，那么在电影例子中，按距离依次排序的三个点分别是动作片 (108,5)、动作片(115,8)、爱情片(5,89)。在这三个点中，动作片出现的频率为三分之二，爱情片出现的频率为三分之一，所以该圆点标记的电影为动作片。这个判别过程就是k-近邻算法。

准备数据集

import numpy as np

"""
 函数说明:创建数据集
 Parameters:    
   ⽆ 
 Returns:
     group - 数据集
     labels - 分类标签
"""


def createDataSet():
    # 四组二维特征
    group = np.array([[1, 101], [5, 89], [108, 5], [115, 8]])
    # 四组特征的标签
    labels = ['爱情片', '爱情片', '动作片', '动作片']
    return group, labels

import numpy as np
import operator

""" 
函数说明:kNN算法,分类器
Parameters:
    inX - 用于分类的数据(测试集)
    dataSet - 用于训练的数据(训练集)
    labels - 分类标签
    k - kNN算法参数,选择距离小的k个点 
Returns:
    sortedClassCount[0][0] - 分类结果 
"""


def classify0(inX, dataSet, labels, k):
    #numpy函数shape[0]返回dataSet的行数
    dataSetSize = dataSet.shape[0]
    #在列向量方向上重复inX共1次(横向)，行向量方向上重复inX共dataSetSize次(纵向)
    diffMat = np.tile(inX, (dataSetSize, 1)) - dataSet
    #二维特征相减后平方
    sqDiffMat = diffMat**2
    #sum()所有元素相加，sum(0)列相加，sum(1)行相加
    sqDistances = sqDiffMat.sum(axis=1)
    #开方，计算出距离
    distances = sqDistances**0.5
    #返回distances中元素从小到大排序后的索引值
    sortedDistIndices = distances.argsort()
    #定一个记录类别次数的字典
    classCount = {}
    for i in range(k): 
        #取出前k个元素的类别
        voteIlabel = labels[sortedDistIndices[i]]
        #dict.get(key,default=None),字典的get()方法,返回指定键的值,如果值不在字典中返 回默认值。
        #计算类别次数
        classCount[voteIlabel] = classCount.get(voteIlabel,0) + 1
    #python3中用items()替换python2中的iteritems()
    #key=operator.itemgetter(1)根据字典的值进行排序    
    #key=operator.itemgetter(0)根据字典的键进行排序
    #reverse降序排序字典
    sortedClassCount = sorted(classCount.items(),key=operator.itemgetter(1),reverse=True)
    #返回次数多的类别,即所要分类的类别
    return sortedClassCount[0][0]

创建数据集并使用k-nn算法测试

预测圆点标记的电影(101，20)的类别，K-NN的k值为3

#创建数据集 
group, labels = createDataSet() 
#测试集 
test = [101,20] 
#kNN分类 
test_class = classify0(test, group, labels, 3) 
#打印分类结果 
print(test_class)

测试结果

以上为矩阵方法实现，为例进一步熟悉该算法，用python一般方法实现一下，代码如下：

import numpy as np
from collections import Counter


def knn_classify(test_data, train_data, label, k):
    distance_list = []
    for train_item in train_data:
        d = distance(test_data, train_item)
        distance_list.append(d)

    # 对距离排序
    np_arr = np.array(distance_list)
    ix_sorted_result = np_arr.argsort()
    # 去前面K个位置
    result_labels = []
    for i in range(k):
        k_ix = ix_sorted_result[i]
        result_labels.append(label[k_ix])

    # 统计出现次数最多的类别
    c = Counter(result_labels)
    test_category = c.most_common()
    return test_category[0][0]


def distance(x, y):
    x_len = len(x)
    a = 0
    for i in range(x_len):
        a += (x[i] - y[i]) ** 2
    # 二维限定
    # a = (x[0] - y[0] ** 2 + (x[1] - y[1]))
    d = a ** 0.5
    return d


def main():
    train_data = [(1, 101), (5, 89), (108, 5), (115, 8)]
    label = ['爱情片','爱情片','动作片','动作片']
    test_data = [101, 20]
    k = 3
    d = distance(test_data, train_data[0])
    print(d)
    result = knn_classify(test_data,train_data,label,k)
    print(result)


if __name__ == '__main__':
    main()

多个特征点，可以用欧氏距离(也称欧几里德度量)

欧氏距离

错误率-分类器给出错误结果的次数除以测试执行的总数。错误率是常用的评估方法，主要用于评估分类器在某个数据集上的执行效果。完美分类器的错误率为0，差分类器的错误率是 1.0。

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 202,529评论 5赞 475
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 85,015评论 2赞 379
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 149,409评论 0赞 335
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 54,385评论 1赞 273
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 63,387评论 5赞 364
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 48,466评论 1赞 281
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 37,880评论 3赞 395
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 36,528评论 0赞 256
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 40,727评论 1赞 295
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 35,528评论 2赞 319
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 37,602评论 1赞 329
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 33,302评论 4赞 318
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 38,873评论 3赞 306
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,890评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 31,132评论 1赞 259
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 42,777评论 2赞 349
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 42,310评论 2赞 342

数据科学（机器学习:k-近邻算法）

k-近邻法简介

准备数据集

推荐阅读更多精彩内容