こんにちは。 漫画「めしにしましょう」が好きすぎて、 著者である小林銅蟲先生のブログ negineesan.hatenablog.com を漁り読む日々を過ごしています。 「小林銅蟲先生っぽい」文章が面白くて文体を真似るファンが続出しているのを観測しており、人気の高さが伺えます。 まだ読んでいない人はめちゃくちゃおもしろいので今すぐ読みましょう。 [まとめ買い] めしにしましょう(イブニングコミックス) 作者: 小林銅蟲メディア: Kindle版この商品を含むブログを見る さて、今日は朝7時に目覚めてしまったので、何を思ったかマルコフ連鎖で「小林銅蟲先生っぽい」文章を自動生成してみることにしました。 ※ブログ掲載にあたって小林銅蟲先生に許可を頂きました。 マルコフ連鎖とは wikipedia を見てもさっぱりでした。 概要だけ把握する場合、 マルコフ連鎖を説明してみる。 | 分析のおはなし
こんにちは! 日本語のウェブサイトを作っていると、日本語特有の問題にぶちあたることがありますよね。 その中でも今回着目したいのは、日本語改行問題。最近、この問題を解決するためのライブラリを公開したので、紹介します。 github.com そもそも日本語改行問題とは何か ウェブブラウザで日本語で書かれたウェブサイトを見ていると、ときどき文章が変なところで改行されているのを目にすることがありますよね。 たとえば、こんなかんじ。 「ソリューション」が「ソリューショ」と「ン」に分かれてしまっています。読みにくいですね。 英語では単語がスペースによって区切られますが、日本語や中国語などのアジア圏の言語では単語がスペースで区切られないことが多いです。 そのため、英語では単語の途中で改行されることは通常ありませんが、日本語では単語の途中で改行されることがよくあります。 本文ならともかく、見出しやキャッチ
あまり細かいことは気にせずテキスト分類器のRubyライブラリを1コマンドで自動生成する便利ツールを作りました。 いろいろ迷走している間に。 gem install nekoneko_genでインストールできます。 なにをするものなのか、ちょっと分かりにくいので、例で説明します。 2ちゃんねるの投稿からどのスレッドの投稿か判定するライブラリを生成する 例として、2ちゃんねるに投稿されたデータから、投稿(レス)がどのスレッドのレスか判定するライブラリを生成してみます。 準備 まず gem install nekoneko_genでインストールします。 Ruby 1.8.7でも1.9.2でも動きますが1.9.2のほうが5倍くらい速いので1.9.2以降がおすすめです。 環境は、ここではUbuntuを想定しますが、Windowsでも使えます。(WindowsXP, ruby 1.9.3p0で確認)
先週、私と @AntiBayes さんとの間にかなり激しい応酬があった。NLP 業界で 私と @AntiBayes さんの二人をフォローしている人たちにはそれが見えたと思う。また、その影響は今後も残るかもしれない(残らなければそれに越したことはないが、私はあまり楽観していない)。この件について、とりあえず私の立場から説明をする。私の立場からなので、知らず知らずのうちに偏ることは避けられないかもしれないが、意識できる範囲では公平な記述を心がける。 まず、いきさつから。 X さん(この人を含めた 3人をフォローしている人にはわかるだろうが、そうでない人にはわからないように ID は出さない)が、「知り合いが、教員同士の派閥争いが原因で、博士への進学を諦めた」とつぶやいた(ログを確認。文面は変えている)。 それに対して @AntiBayes さんが、「その人が派閥争いのないお花畑のような職場に行
リリース、障害情報などのサービスのお知らせ
最新の人気エントリーの配信
処理を実行中です
j次のブックマーク
k前のブックマーク
lあとで読む
eコメント一覧を開く
oページを開く