当前位置: 首页 > news >正文

技术先进的网站建设公大企业网站建设公司排名

技术先进的网站建设公,大企业网站建设公司排名,广州免费律师咨询,小清新网站源码word2vec介绍word2vec是google的一个开源工具#xff0c;能够根据输入的词的集合计算出词与词之间的距离。它将term转换成向量形式#xff0c;可以把对文本内容的处理简化为向量空间中的向量运算#xff0c;计算出向量空间上的相似度#xff0c;来表示文本语义上的相似度。…word2vec介绍word2vec是google的一个开源工具能够根据输入的词的集合计算出词与词之间的距离。它将term转换成向量形式可以把对文本内容的处理简化为向量空间中的向量运算计算出向量空间上的相似度来表示文本语义上的相似度。word2vec计算的是余弦值距离范围为0-1之间值越大代表两个词关联度越高。词向量用Distributed Representation表示词通常也被称为“Word Representation”或“Word Embedding(嵌入)”。简言之词向量表示法让相关或者相似的词在距离上更接近。具体使用(处理中文)收集语料本文亚马逊中文书评语料12万句子文本。语料以纯文本形式存入txt文本。注意理论上语料越大越好理论上语料越大越好理论上语料越大越好重要的事情说三遍。因为太小的语料跑出来的结果并没有太大意义。分词中文分词工具还是很多的我自己常用的- 中科院NLPIR- 哈工大LTP- 结巴分词注意分词文本将作为word2vec的输入文件。分词文本示例word2vec使用python利用gensim模块。win7系统下在通常的python基础上gensim模块不太好安装所以建议使用anaconda具体参见 python开发之anaconda【以及win7下安装gensim】直接上代码——#!/usr/bin/env python# -*- coding: utf-8 -*-功能测试gensim使用处理中文语料时间2016年5月21日 20:49:07from gensim.models import word2vecimport logging# 主程序logging.basicConfig(format%(asctime)s : %(levelname)s : %(message)s, levellogging.INFO)sentences word2vec.Text8Corpus(uC:\\Users\\lenovo\\Desktop\\word2vec实验\\亚马逊中文书评语料.txt) # 加载语料model word2vec.Word2Vec(sentences, size200) # 默认window5# 计算两个词的相似度/相关程度y1 model.similarity(u不错, u好)print u【不错】和【好】的相似度为, y1print --------\n# 计算某个词的相关词列表y2 model.most_similar(u书, topn20) # 20个最相关的print u和【书】最相关的词有\nfor item in y2:print item[0], item[1]print --------\n# 寻找对应关系print u书-不错质量-y3 model.most_similar([u质量, u不错], [u书], topn3)for item in y3:print item[0], item[1]print --------\n# 寻找不合群的词y4 model.doesnt_match(u书 书籍 教材 很.split())print u不合群的词, y4print --------\n# 保存模型以便重用model.save(u书评.model)# 对应的加载方式# model_2 word2vec.Word2Vec.load(text8.model)# 以一种C语言可以解析的形式存储词向量model.save_word2vec_format(u书评.model.bin, binaryTrue)# 对应的加载方式# model_3 word2vec.Word2Vec.load_word2vec_format(text8.model.bin, binaryTrue)if __name__ __main__:pass运行结果【不错】和【好】的相似度为 0.790186663972--------和【书】最相关的词有书籍 0.675163209438书本 0.633386790752确实 0.568059504032教材 0.551493048668正品 0.532882153988没得说 0.529319941998好 0.522468209267据说 0.51004421711图书 0.508755385876挺 0.497194319963新书 0.494331330061很 0.490583062172不错 0.476392805576正版 0.460161447525纸张 0.454929769039可惜 0.450752496719工具书 0.449723362923的确 0.448629021645商品 0.444284260273纸质 0.443040698767--------书-不错质量-精美 0.507958948612总的来说 0.496103972197材质 0.493623793125--------不合群的词 很以上就是本文的全部内容希望对大家的学习有所帮助也希望大家多多支持脚本之家。
http://www.huolong8.cn/news/296417/

相关文章:

  • 佳木斯哈尔滨网站建设灯罩技术支持东莞网站建设
  • 邯郸网站建设邯郸网站制作厦门关键词优化平台
  • 西安 网站建设 培训班html门户网站开发源代码
  • 百度怎么收录网站asp.net 新建网站
  • 怎么更换网站模板邵武建设局网站
  • 可信网站认证 代理商护肤网站的功能设计
  • 深圳网站建设优化城阳网站建设培训
  • 100个免费推广网站下载京东的网络营销方式
  • 网站内页做排名福州网站建设资讯
  • 网站建设相关行业有哪些正规营销型网站建设公司
  • 南通设计网站建设360建筑网怎么删除简历
  • 郑州市的实惠推广网站百度商桥网站代码去哪里添加
  • 系统网站怎么做网站开发jquery
  • 自适应网站如何做mip网站后台管理系统软件
  • 网站制作建设公司哪家好开鲁网站seo免费版
  • asp企业网站如何在电脑安装wordpress
  • 做网站需要软件做网站网页需要学些什么
  • 上海网站建设外包公司企业网站开发定制
  • 咸宁网站seo颐高养生园网站建设
  • wordpress站点后台wordpress主题下载
  • 怎样申请做c c 网站wordpress 添加xml
  • 网站开发有什么技术要求调用wordpress的文章编辑器
  • 西宁网站运营公司海外电商有哪些平台
  • 小说网站防盗做的好处推广普通话的内容简短
  • 做网站的公司经营范围柳州市建设中心网站
  • 旅游网站的建设的文献综述百度热搜榜在哪里看
  • 茌平企业做网站推广wordpress 文章引用
  • 响应式网站尺寸节点网站建设移交手续
  • 多用户商城(c2c)网站制作方案婚庆网站开发
  • 织梦怎么在本地编辑多个网站群晖wordpress修改80端口