2015年9月8日火曜日

【無料】サクっとTwitterのテキストマイニングが出来る~TWKEY(ツイッキー)

 一見地味なんですが、とても有用なサービスに感じたのでご紹介です。
いつか、こういうサービス作ってみたいなぁ。

TWKEY(ツイッキー)とは?

 Twitter上でつぶやかれた特定の単語をつぶやきをWEB上でサクっとテキストマイニング可能なサービスです。しかも無料です。


使ってみた

スクリーンショット貼る必要がないぐらい説明が簡単な仕組みですが、いちおう、いつもどおり。
まずは調べたいキーワードを入力して「見つける」ボタンを押してください。

「処理に1分ぐらいかかります」的なメッセージが出ますが、実際は30秒もかかりませんでした。
Twitter上に含まれるキーワードと出現回数が表示されます。


 ご丁寧にCSVでアウトプットも可能です。最近、小野伸二・稲本潤一・ナザリトの三人が先発して勝利を飾った試合に関するツイートが多かったようです。



<その他テキストマイニング関連のエントリー>
超絶簡単!「UserLocal(ユーザーローカル)テキストマイニング」サービス
http://sapporomkt.blogspot.jp/2015/07/userlocal.html

Tiny Text Minning(TTM)によるテキストマイニング(データの前処理)
http://sapporomkt.blogspot.jp/2015/02/tiny-text-minningttm.html

(札幌市)秋元市長の記者会見をテキストマイニングしてみた。
http://sapporomkt.blogspot.jp/2015/09/blog-post.html

高橋はるみ知事の記者会見をテキストマイニングしてみた。
http://sapporomkt.blogspot.jp/2015/06/blog-post_17.html

高橋はるみ知事の記者会見をテキストマイニングしてみた(ちょっとだけ工夫Version)
http://sapporomkt.blogspot.jp/2015/07/httpsapporomkt.html

ルタオで人気の「ナイアガラ」レビューをテキストマイニングしてみた。

http://sapporomkt.blogspot.jp/2015/01/blog-post.html

ユーザーローカルの無料RT分析ツールで飯田里穂 (りっぴー)等を調べてみた。
http://sapporomkt.blogspot.jp/2015/08/rt.html

2015年9月7日月曜日

【R言語】data.frameの列名変更は全部上書きで。

 いままであまり意識していなかったのですが、data.frameの列名変更で躓いたので。

 

サンプルデータ


 列名に何も名前が付いていないdata.frame(V1,V2,V3・・・みたいなデータ)を用意してください。以前、当ブログでご紹介した「readHTMLTable関数」や「import.io」等をご利用ください。


(R言語)readHTMLTable関数でJ2の順位を音速で抜き出す。

http://sapporomkt.blogspot.jp/2015/07/rreadhtmltablej2.html

無料のスクレイピングサービス「import.io」が脅威の進化!(いつのまにか)
http://sapporomkt.blogspot.jp/2015/08/importio.html

 

ソースコード


# CSVファイルの読み込み。無理やり列名無しにしたければ「header = FALSE」オプションつけても可。
jbis <- read.csv("JBIS_2015.csv")
head(jbis)


















# ここの「link_1._text」が種牡馬名に該当するのでリネームしたい。
# 最初、colnames(jbis[2]) <- "種牡馬名" でトライしたのですが、変更されずorz
# いろいろ調べると、「data.frameの列名は全列上書きでないとNG」とのこと。
# とりあえず、全列名を記載したベクトルを準備します。








# colnames()に全部ぶっこむ!2列目が「種牡馬名」になっていますね。
colnames(jbis) <- new_name
head(jbis)

2015年9月6日日曜日

「札幌でしかできない50のこと」発表!(2015年9月3日(木))

 先日(2015年9月3日(木))、札幌市役所において
「ガイドマップ「札幌でしかできない50のこと」」の発行記念発表会が開催され、同席してまいりました。

当ガイドマップ制作に関する経緯


 当ガイドブックは札幌市のほか北海道大学や民間事業者で構成する「さっぽろ観光創造研究会」とタイムアウト東京との協力により制作されました。こちらの「民間事業者」として弊社(株式会社インサイト)マーケティング担当として私:小田一弥と相沢直人も協力させて頂きました。
(その他、日本オラクル様、北洋銀行様も本件に参画されております)

「タイムアウト東京」について


 タイムアウトは、1968年にロンドンで創刊して以来、街の目利きガイドとして支持され、現在はロンドンを中心にニューヨーク、上海、クアラルンプール、シドニー、テルアビブ、シンガポール、リオデジャネイロなど、世界108都市、39か国、12言語で展開する、ユニークなシティガイドです。タイムアウトロンドンは2012年のロンドンオリンピック・パラリンピックでは公式トラベルガイドとして採用されたほか、タイムアウト東京は観光庁が発行する訪日旅行公式ガイドブックを作成するなど、世界的なブランド力のあるシティガイドとして知られています。 

「札幌でしかできない50のこと」とは


 その街でしかできない50のことをタイムアウト独自の「TO DO形式」のレビューで紹介するガイドブックの札幌版です。


当マップ、ジャバラ折りになっていますので、携帯もしやすくなっています。


 50件のコンテンツにはそれぞれ印象的なコピーとともに、「どのようなことができるか」が端的にまとめられています。僕が好きな「ショコラティエ マサール」さんも紹介されています。


 また、ご丁寧に我々の名前も掲載して頂きました!


配布情報など


■ 発行部数・言語
  日本語・英語各5万部
■ 配布開始日
  2015年9月4日より無料配布
■ 主な配布場所
(札幌市内)北海道さっぽろ観光案内所、大通情報ステーション、大通観光案内所、市内ホテル・ゲストハウス、(東京都内)羽田空港国際線ターミナル、タイムアウトカフェ&ダイナーなどで順次配布
■ WEBサイト
http://www.timeout.jp

2015年9月3日木曜日

【悲報】「生活行動日記BLOG」サービスが終了・・・

 先日、とても悲しいお知らせが届きました。
株式会社ドゥ・ハウスさんが運営する「生活行動日記BLOG」サービスが残念ながら2015年10月30日(金)午前11時をもって終了するとのことです・・・。

「生活行動日記BLOG」サービスってなに?


 約50,000件の主婦の生活行動を定性データで検索できるサービスです。ブログ形式で探索的に日記データを検索することができ、特定のキーワード(牛肉)等で絞り込み検索をすることも可能です。

 数百件単位の日記データを無料で利用可能なデータソースだったのでホントに残念(T.T)



最後なので便利な使い方を。



 実はこのサービス、通常では100件程度しか日記データを取得できない仕様のため、 テキストマイニング等を行おうにもデータ不足で活用しづらい感がありました(個人的感想です)

 ただ、詳細な検索メニューで「季節」をオプション検索できるのですが、こちらを「春・夏・秋・冬」と別々に検索すると、重複のないデータが数百件単位で取得することが可能となります。


 サービス終了まであと僅かなので、ご興味のある方は一度ご利用になってはいかがでしょうか。
テキストマイニングの勉強用データにはうってつけだと思いますよ。

2015年9月1日火曜日

(札幌市)秋元市長の記者会見をテキストマイニングしてみた。

 以前、高橋はるみ北海道知事の記者会見の様子をテキストマイニングしたことがあります。

高橋はるみ知事の記者会見をテキストマイニングしてみた。
http://sapporomkt.blogspot.jp/2015/06/blog-post_17.html

 今回は札幌市の秋元市長の記者会見書きお越しデータをテキストマイニングしてみます。ちなみに、冒頭からアレなんですが、特に発見感とか求めないでください(笑) ただ、やってみたかっただけなんです・・・。

やったこと(データソース)


 過去7回分に及ぶ秋元市長の記者会見書きお越しを全部コピペ。
※各パートのタイトル文等も面倒だったので削除していません。
https://www.city.sapporo.jp/city/mayor/interview/index.html

→全部で「80,998字」ありました(笑)



結果


 まずは、ワードクラウド。せっかくなので、ユーザーローカルさんのWEB上で出来る無料テキストマイニングサービスを使ってみました。

<ワードクラウド>
続いて、形態素解析での単語ランキング表。


 こちらは「多次元尺度構成法(MDS)」のマップ。各記者会見で語る議題がしっかり固まっているので、結果、議題ごとにクラスターが出来ているのかなって感じです。


 最後は、共起ネットワークマップ。語り口が明快で簡潔なこともあり、気のせいかもしれませんが、マップが綺麗になっているような・・・気がします。気のせいかも知れません(笑)

言及したくなるのは、せいぜい、「人口減少対策」ぐらいですかね。
もう少し、広範な議題で語られた内容になると、もう少し発見感が出てくるかなと思います

2015年8月31日月曜日

無料のスクレイピングサービス「import.io」が脅威の進化!(いつのまにか)

 以前から気になっていたのですが、久々に「import.io」のページを見たところ脅威の進化を遂げていたのでご紹介。


「import.io」って何?


 WEB上で超簡単に「スクレイピング」が出来るサービスです。「スクレイピング」という言葉自体、あまり馴染みがないと思いますが、HTMLで組まれた数表やレビューテキストからデータを抜き出す作業を意味します。

  以前、当ブログで紹介したR言語のパッケージ等を利用しても良いかと思いますが、ちょっと技術的にハードルが高い気もします。
他にはRubyで構文解析システムを使用したこともありますが、環境設定だけで心折れます(笑)

 「import.io」は、このようなプログラミング知識がゼロでも、数秒でサクっとデータを抜き出せる超絶便利ツールです。
以前からリリースされていたものの、ユーザーインタフェースがわかりづらく挫折しちゃいましたが、今度は余裕で理解出来ました。


使ってみよう!


 まずは、同社サイトでユーザー登録を済ませておいてください。無料です。
登録が完了しましたら「Sign in」の状態にしておいてください。


 以前、当ブログでも紹介した「J2順位表」ページにアクセスし、URLをコピペしておいてください。



 最初に掲載したimport.ioページのURL欄にURLをペースト後、「Try It Out」ボタンを押すと、下記のような画面になります。データ概要を確認したら左下の「Download CSV」ボタンを押してください。


 ダイアログが表示されます。「Download (  ) pages」の値を変更すると、同一フォーマットのページをクローリング(巡回)してデータを抜き出してくれます。


 ダウンロード直後のデータフォーマットです。R言語の「readHTMLTable関数」と比べると、行タイトルの抜き出しは出来ていませんが、それ以外は完璧です。


 「クローリング」精度については、他ページでも検証しましたが、ページ構成によって可否が別れるようです。同一ページを「Download (  ) pages」の値分ぐるぐる読み込んでいたケースもありましたので、ダウンロード後はしっかりご確認くださいね。

 参考ページ:(R言語)readHTMLTable関数でJ2の順位を音速で抜き出す。
http://sapporomkt.blogspot.jp/2015/07/rreadhtmltablej2.html

2015年8月30日日曜日

【R言語】with関数って便利(小ネタ)

 「いまさら?」と言われそうですが、R言語の「with関数」って便利ですね。
データフレームの各列を指定する際、わざわざデータフレーム名を入力せずとも、列名だけでOKとなります。最近、「みんなのR」本(マイナビ)勉強中に初めて知ったとです。


サンプルデータ

以前、当ブログで紹介したreadHTMLTable関数でJ2の順位データを抜き出してください。

(R言語)readHTMLTable関数でJ2の順位を音速で抜き出す。
http://sapporomkt.blogspot.jp/2015/07/rreadhtmltablej2.html


ソースコード


# csvファイルの取り込み。header=FALSE だと行タイトルを読み込みません。
J2 <- read.csv("~/J2.csv", header=TRUE, sep =",")
# 一応データチェック。
View(J2)
# 一試合毎の平均得点数を算出。with関数を使うと、毎回「J2$」が不要に。
J2$平均得点 <- with(J2,得点 / 試合数)
# せっかくなので、平均得点数で降順ソート。
J2 <- J2[order(J2$平均得点, decreasing = TRUE),]
View(J2)