投稿

ラベル(機械学習)が付いた投稿を表示しています

wikipediaデータを綺麗にしてからWord2vecやってみた

今更な感じですが色々とあって Word2Vec で類義語分析とか表記ゆれとかできないかと思ってお勉強兼実験しました。 もう一人のボク のためにその時のメモを置いておきます。データ加工してからword2vec使って関連する語出すとこまでです。相変わらずほぼコピペだけどね。そして corpusのつづりを間違えているのはお約束です。へぼすぎだな(笑) ■手順概要 1.ディスク容量拡張 2.関連ライブラリインストール 3. コーパス 準備  ・ Wikipediaの日本語ダンプ をダウンロード(約2時間)  ・ダウンロードしたデータから記事本文抽出(約2時間10分)  ・抽出した記事本文のクリーニング(約15分)  ・記事データを1ファイルにマージ(約5分)  ・ 形態素解析 して 分かち書き に変換(約30分)  ・ モデル学習 (約2時間) 4.サンプルで遊ぶ ■実際のコマンドやプログラムなど 1.ディスク容量拡張 Hyper-Vのディスク容量が20GB程度しかなくwikipediaのデータが 2GBほどあるとのことなのでディスク容量に余裕を持たせるために ディスクを拡張した。仮想マシンが上がっていない状態で容量拡張 ・Hyper-Vマネージャからディスクの編集で容量を拡張 ・Hype-Vマシンを起動後に以下のコマンドでUbuntu上で拡張 $ sudo fdisk -l $ sudo parted GNU Parted 3.2 /dev/sda を使用 GNU Parted へようこそ! コマンド一覧を見るには 'help' と入力してください。 (parted)print ~中略~ 修正/Fix/無視(I)/Ignore? Fix 番号 開始 終了 サイズ ファイルシステム 名前 フラグ 1 1049kB 538MB 537MB fat32 EFI System Partition boot, esp 2 538MB 21.5GB 20.9GB ext4 ~中略~ (parted) resizepart 2 警告: パーティション /dev/sda2 は使用中です...

pythonでWordCloudやってみた

前回 は Mecab で 形態素解析 して単語の出現数を出すとこまでやりましたが、本来は WordCloud を作ってみたいというのがあったので、前回のプログラムを改修して WordCloud出力機能を付けてみました。 やり方自体は以下のサイト見れば幾らでも書いてあるのでがっつりコピペで仕上げました。巨人の肩に乗って仕上げるのが一番いいんですよこういうのは ◆参照サイト http://mmtomitomimm.blogspot.com/2018/12/word-cloud.html http://pynote.hatenablog.com/entry/python-wordcloud https://biosciencedbc.jp/nbdc-blog/1068-20181219-00 http://www.dskomei.com/entry/2018/04/11/001944 https://teratail.com/questions/167701 http://syu-m-5151.hatenablog.com/entry/2016/12/19/001736 https://www.suzu6.net/posts/111-amcharts-word-cloud/ http://memopy.blogspot.com/2017/10/python.html http://irukanobox.blogspot.com/2018/12/python.html ◆追加手順 1.フォントのインストール     今回はUbuntu18.04のサーバなのでフォントがないから追加インストール   IPAフォント にしました。 $ sudo apt install -y fonts-ipaexfont ◆ソースコード  前回のファイル出力部分にWordCloudのpng出力機能を追加しました。  なのでそこまで大きく変更はありません。(wordcloud用の関数追加位) import collections import csv from operator import itemgetter import requests import sys import traceback import matp...

pythonでテキスト解析用環境作って単語数の分析してみた。

いろんなところで使い古されている テキストマイニング なぞを今更ながらやってみようかと思って環境を構築してサンプルプログラムを作ってみました。これも先人が色々されている Mecab でやってみたです。もはや時代遅れ以外の何物でもないです。 環境は Hyper-V 上に Ubuntu18.04LTSServer 立ててそこで python3.6 にて構築してみた。まぁずぶの素人が3日ほど格闘して何とか形になりましたよ。後はここから流行りの WordCloud とかに持って行ければ面白いんだろうなぁ。ひとまずは単語の出現数を降順で並べるだけまでを先に実装しました。といってもほとんどコピペです。 1.環境構築   そこまでてこずらないかと思いきや、 Cabocha のインストールに手間取ったのと  aptに時間がかかりまくったのが鬼門でした。 ◆参考サイト   https://qiita.com/furipon308/items/0d626f4a943c99fe32c6   http://tech.wonderpla.net/entry/2017/10/10/110000   https://mojitoba.com/2019/01/29/solve-error-installation-mecab-python3/   http://godan09.hatenablog.com/entry/2017/06/24/152201   https://qiita.com/Sylba2050/items/4aaff94769726b8c9581   https://www.trifields.jp/install-cabocha-in-ubuntu-1038   https://qiita.com/woody-kawagoe/items/09c0f89a55701bcf72eb   https://qiita.com/january108/items/85c80769ea870c190eaa   https://qiita.com/segavvy/items/2f686cfb0065c8cbe698   https://kakubari-ryusei.hatenablog.com/entry/2017/10/04/192447   https...