導入から 10 年、PHP の trait は滅びるべきなのか その適切な使いどころと弱点、将来について
We have retired the initial release of Snowflake and working on open sourcing the next version based on Twitter-server, in a form that can run anywhere without requiring Twitter's own infrastructure services. The initial version, released in 2010, was based on Apache Thrift and it predated Finagle, our building block for RPC services at Twitter. The Snowflake we're using internally is a full rewri
【論文】M. Datar, N. Immorlica, P. Indyk, and V.S. Mirrokni, Locality-Sensitive Hashing Scheme Based on p-Stable Distributions, Proceedings of the twentieth annual symposium on Computational geometry, 2004. Overview Locality Sensitive Hashing(以下LSH,局所性鋭敏型ハッシュ)は高次元データを次元圧縮するための手法で,圧縮したデータによるハッシュテーブルを作成して,効率的に近似的最近傍探索を行うための手法です.基本的なアイディアとしては高次元空間内での距離が近い2つのベクトルが,ハッシュテーブルにおいて高確率で同じバケットに入るように確率的な処理を行うと
局所性鋭敏型ハッシュ(きょくしょせいえいびんがたハッシュ、英語: locality sensitive hashing)とは高次元のデータを確率的な処理によって次元圧縮するための手法である。ハッシュの基本的な考え方は類似したデータが高確率で同じバケットに入るようにデータを整理するというものである。多くの場合においてこのバケットの数は入力されるデータサンプルの数よりもずっと小さくなる。 局所性鋭敏型ハッシュを行うためのパラメータの集合をLSH族(Locality Sensitive Hashing Family)と呼ぶ。LSH族は距離空間と閾値、近似因子によって定義される。LSH族[1][2]は2点について次の2つの性質、 ならばとなる確率は以上である。 ならばとなる確率は以下である。 を満たす関数により与えられる族であり,はから一様乱数にしたがって選択される。このときは2点の距離を表す関数
partake.in でダブル配列に関する発表をすることが決まったので,どのような内容にするか検討中です.ダブル配列の概要についてはブログや書籍などで説明されているので,もう少し踏み込んだ内容にしようと思っています. 候補としては以下のようなものがあります. 基本 BASE, CHECK 二本の配列にわけたとき 一本の配列にまとめたとき 演算方法 加減算と排他的論理和 構築 効率化 未使用要素の連結リスト化 未使用要素をブロック単位で管理 ラベルによる連結リスト化 静的構築 深さ優先と幅優先 圧縮 TAIL のマージ 完全一致のみ 終端文字があるとき 終端文字がないとき CHECK のラベル化 BASE の重複回避 グラフ化の可能性 相対オフセットと拡張フラグ 小さい要素を使って大きなダブル配列を実現する方法 DAWG Darts-clone 発表時間は 15 分なので,広く浅く説明するこ
折角DSIRNLPに来たので、NLPっぽいことをして遊んでみた話。ネタです。 コードは https://github.com/naoyat/latin にあります。lda_demo.py というやつです。 gensim便利です。PythonからLDAとかLSIとか割と高速にやってくれるトピックモデリングライブラリです。 http://radimrehurek.com/gensim/ ↑チュートリアルが分かりやすくてためになるのでぜひご一読を! from gensim import corpora, models, similarities 元テキスト 初級ラテン語リーディングで読んだラテン語テキストをコーパスにしましょう text = latin.textutil.load_text_from_file('latin.txt') print text Thēseus et Ariadnē.
A finite-state transducer (FST) is a finite-state machine with two memory tapes, following the terminology for Turing machines: an input tape and an output tape. This contrasts with an ordinary finite-state automaton, which has a single tape. An FST is a type of finite-state automaton (FSA) that maps between two sets of symbols.[1] An FST is more general than an FSA. An FSA defines a formal langua
はじめに データ整形やスケール調整、パラメータの探索を行うことでどれだけ変わるか気になったので、liblinearを使って文書分類を試してみる。 liblinear http://www.csie.ntu.edu.tw/~cjlin/liblinear/ version 1.93を利用 使用するデータ http://www.csie.ntu.edu.tw/~cjlin/libsvmtools/datasets/multiclass.html 「news20」を使用する 20クラス 学習:15935データ、テスト:3993データ 素性数:学習62061、テスト62060 news20.bz2とnews20.t.bz2は、単語IDとTF値のペアっぽい #学習データの各クラスのドキュメント数 $ cut -f1 -d" " news20 | sort |uniq -c | sort -k2 -n
セマンティックWebという言葉の意味に踏み込んだ文書データ処理が話題になって10年くらい経つと思いますが、華々しくサービスとして使われているとは耳にしませんし、ユーザーとしてもその恩恵に預かってる感覚はありません。やはり表記ゆれや同義語、意味階層に関する膨大なルール体系(オントロジー)を完璧に作り上げたり、コンテンツに対するメタデータ付けたりという人手のボトルネックが解消されなかったことが原因なのでしょうか。そんな停滞したエリアに、Googleがいつも通り少々暴力的(?)な方法で一石を投じる成果を公開したようです。 From Words to Concepts and Back: Dictionaries for Linking Text, Entities and Ideas [Google Research Blog] 中身はいたってシンプルで、英語版Wikipedia記事1ページをそ
CMSI計算科学技術特論B(15) インテル Xeon Phi コプロセッサー向け最適化、並列化概要 2
【Unite Tokyo 2019】今すぐ現場で覚えておきたい最適化技法 ~「ゲシュタルト・オーディン」開発における最適化事例~
[DL輪読会]Understanding Black-box Predictions via Influence Functions
リリース、障害情報などのサービスのお知らせ
最新の人気エントリーの配信
j次のブックマーク
k前のブックマーク
lあとで読む
eコメント一覧を開く
oページを開く