投稿

ラベル(テキストマイニング)が付いた投稿を表示しています

pythonでRSSを取得してみる

前回 はWordCloud作ってみましたが、そんだけだとテキストファイルをいちいち整形しないといけないので、なんか自動で情報取得できないかなぁと思ってRSSフィードの内容を取得するプログラムなんかあればWordCloudに食わせるファイル作るの楽になるんじゃないかなぁと思って RSSフィード 取得ツールを作ってみました。 んーエラー制御がザルですのでダメダメですけど、、、 ◆参照サイト 1.CSV取扱い関連 https://note.nkmk.me/python-csv-reader-writer/ http://esu-ko.hatenablog.com/entry/2016/02/16/Python%E3%81%A7CSV%E3%83%95%E3%82%A1%E3%82%A4%E3%83%AB%E3%82%92%E6%89%B1%E3%81%86%28%E3%83%AA%E3%82%B9%E3%83%88%E3%82%84%E8%BE%9E%E6%9B%B8%E3%81%A8%E3%81%AE%E3%82%A4%E3%83%B3%E3%82%BF%E3%83%BC%E3%83%95 https://qiita.com/nabenabe0928/items/fcdf2c81e5fff3364c6f http://kaworu.jpn.org/python/Python%E3%81%A7CSV%E3%83%95%E3%82%A1%E3%82%A4%E3%83%AB%E3%82%92%E8%AA%AD%E3%81%BF%E6%9B%B8%E3%81%8D%E3%81%99%E3%82%8B%E6%96%B9%E6%B3%95 http://y0m0r.hateblo.jp/entry/20120712/1342100284 https://www.craneto.co.jp/archives/1309/ http://pynote.hatenablog.com/entry/python-csv-io-recipe https://www.sejuku.net/blog/68322 https://qiita.com/shinsaka/items/299159968d7226c9bdb9 https://qiita.com/hkambe/it...

pythonでWordCloudやってみた

前回 は Mecab で 形態素解析 して単語の出現数を出すとこまでやりましたが、本来は WordCloud を作ってみたいというのがあったので、前回のプログラムを改修して WordCloud出力機能を付けてみました。 やり方自体は以下のサイト見れば幾らでも書いてあるのでがっつりコピペで仕上げました。巨人の肩に乗って仕上げるのが一番いいんですよこういうのは ◆参照サイト http://mmtomitomimm.blogspot.com/2018/12/word-cloud.html http://pynote.hatenablog.com/entry/python-wordcloud https://biosciencedbc.jp/nbdc-blog/1068-20181219-00 http://www.dskomei.com/entry/2018/04/11/001944 https://teratail.com/questions/167701 http://syu-m-5151.hatenablog.com/entry/2016/12/19/001736 https://www.suzu6.net/posts/111-amcharts-word-cloud/ http://memopy.blogspot.com/2017/10/python.html http://irukanobox.blogspot.com/2018/12/python.html ◆追加手順 1.フォントのインストール     今回はUbuntu18.04のサーバなのでフォントがないから追加インストール   IPAフォント にしました。 $ sudo apt install -y fonts-ipaexfont ◆ソースコード  前回のファイル出力部分にWordCloudのpng出力機能を追加しました。  なのでそこまで大きく変更はありません。(wordcloud用の関数追加位) import collections import csv from operator import itemgetter import requests import sys import traceback import matp...

pythonでテキスト解析用環境作って単語数の分析してみた。

いろんなところで使い古されている テキストマイニング なぞを今更ながらやってみようかと思って環境を構築してサンプルプログラムを作ってみました。これも先人が色々されている Mecab でやってみたです。もはや時代遅れ以外の何物でもないです。 環境は Hyper-V 上に Ubuntu18.04LTSServer 立ててそこで python3.6 にて構築してみた。まぁずぶの素人が3日ほど格闘して何とか形になりましたよ。後はここから流行りの WordCloud とかに持って行ければ面白いんだろうなぁ。ひとまずは単語の出現数を降順で並べるだけまでを先に実装しました。といってもほとんどコピペです。 1.環境構築   そこまでてこずらないかと思いきや、 Cabocha のインストールに手間取ったのと  aptに時間がかかりまくったのが鬼門でした。 ◆参考サイト   https://qiita.com/furipon308/items/0d626f4a943c99fe32c6   http://tech.wonderpla.net/entry/2017/10/10/110000   https://mojitoba.com/2019/01/29/solve-error-installation-mecab-python3/   http://godan09.hatenablog.com/entry/2017/06/24/152201   https://qiita.com/Sylba2050/items/4aaff94769726b8c9581   https://www.trifields.jp/install-cabocha-in-ubuntu-1038   https://qiita.com/woody-kawagoe/items/09c0f89a55701bcf72eb   https://qiita.com/january108/items/85c80769ea870c190eaa   https://qiita.com/segavvy/items/2f686cfb0065c8cbe698   https://kakubari-ryusei.hatenablog.com/entry/2017/10/04/192447   https...