Check out Google I/O live to discover the latest innovations and product announcements about Google Search and much more. Watch the livestream
Solr is the blazing-fast, open source, multi-modal search platform built on the full-text, vector, and geospatial search capabilities of Apache Lucene™. Learn more about Solr. Solr is highly reliable, scalable and fault tolerant, providing distributed indexing, replication and load-balanced querying, automated failover and recovery, centralized configuration and more. Solr powers the search and na
GETAssoc GETAssocは、国立情報学研究所高野研究室で開発された連想検索エンジンです。 特長 高速な文書検索 HTTPインターフェースのサポート 複数データベース間の横断検索が可能 複数CPU対応による負荷分散 インデックスの差分更新対応 検索インデックスの構築が容易 任意の類似度尺度が記述可能 オープンソース News 2009/09/04 GETAssoc 1.1 をリリースしました。 2009/07/21 GETAssoc 1.0 をリリースしました。 ダウンロード GETAssocはフリーソフトウェアです。修正BSDライセンス(Revised BSD License, 宣伝条項無し)に従って本ソフトウェアを使用、再配布することができます。 stmd-1.1.5.tar.gz getassoc-1.1.5.tar.gz getassoc-1.1.0.zip (Window
情報検索の分野でよく使われるアルゴリズムで「TF/IDF」というものがあります。 ドキュメントの中から「特徴語」を抽出する、といったような用途でよく使われています。 TF/IDFアルゴリズムのくわしい解説はこことかここを見てください。 今回はこのTF/IDFの計算を「簡単」に実現するためのperlモジュールをCPANに上げましたので、ご紹介します。なまえはLingua::JA::TFIDFといいます。 Lingua::JA::TFIDF - TF/IDF calculator based on MeCab. http://search.cpan.org/~miki/Lingua-JA-TFIDF TF/IDF実装の困りどころ TF/IDFの実装を試みた方であればわかると思うのですが、実際にやろうとすると、TF(Term Frequency)の計算はなんら難しくありませんが、IDF(Inve
(IMPORTANT NOTICE) This site is archived and no longer maintained. It is available solely for informational and historical purposes. What this website can do for you This website is a proof of concept that a better Social Media can exist ; a social media based on interests and "personal relevancy" instead of popularity. And this, really is the next step in social media! Here is what it can do for
はてなダイアリーのようにキーワードを自動でリンクするアルゴリズムを知りたいです。単純に考えると、①キーワードのリストを持っておく。②対象となる文章に、あるキーワードが含まれているかを検索する。③「②」の検索をキーワードの数だけ繰り返す。ということになると思います。1万語のキーワードリストがある場合、1万回の検索を行うことになり、たとえば多数の投稿がある場合は効率も悪いですし負荷も掛かります。もっと効率のいいアルゴリズムがあるのでしょうか。
Lux IO is a yet another fast database manager. It supports B+-tree and Array index in either cluster or non-cluster index. It's originally designed for storing large expanding data as a value in Lux Search Engine, but it's also pretty fast for small and a large number of data. Fast key lookup (B+-tree, Array) Support both clustered and non-clustered index mmap(2) the whole index structure in clust
未踏IT人材発掘・育成事業(本体):2008年度上期採択プロジェクト概要(山田PJ) 1.担当プロジェクトマネージャー 石川 裕(東京大学大学院 情報理工学系研究科 教授) 2.採択者氏名 3.未踏プロジェクト管理組織 株式会社メルコホールディングス 4.採択金額 6,000,000円 5.テーマ名 全文検索エンジンLuxの開発 6.関連Webサイト http://luxse.sourceforge.net/ 7.申請テーマ概要 近年、ハードディスクの大容量化、低価格化に伴い、ウェブサービスは大量のデータを保持するようになってきています。それを支えるシステムとして、リレーショナルデータベースや検索エンジンなどがあり、それらはウェブサービスの開発には必須のものとなりつつあります。一般ユーザを対象としたウェブのサービスの開発では、オープンソースのシステムを効率的に利用することにより、サービスや
本日、全文検索エンジンLuxを公開しました。 昨年の3月ぐらいから、土日の空いた時間を使ってだらだら作っていたのですが、完璧にしてから公開しようとすると、いつまで経っても公開できないので、晒すことにしました。なので、機能的に足りない部分がたくさんあります。 特徴としては、以下のような感じです。 C++で記述されている シンプル 高速に動作 そこそこ拡張性が高い シンプルな転置インデックス形式の検索エンジンです。今のところ形態素でしかインデックスを作れませんが、N-Gramはすぐに対応しようと思います。また、APIが若干おかしかったり、手抜き部分が沢山あるので、今後にご期待ください。(version 1.0 ぐらいから自信をもって薦められるかも) ドキュメントが全くないので、これからちょこちょこ書いていこうかと思いますが、マニアックな方はぜひ使ってみて、ご意見・ご感想を頂ければと思います。ダ
こんにちは 。 検索 関連 を 担当 して いる やましー です 。 今回は livedoor で提供しているサービスの中の「検索関連」について書きます。 このブログでも過去に何度か取り上げられていますが、livedoor では検索エンジンとして HyperEstraier、lucene、mysql + senna、Namazu、SUFARY などを利用しています。 その中で lucene の利用方法や機能拡張について説明します。 lucene とは Apache Lucene は、Java で書かれた高性能で高機能な検索エンジンライブラリです。全文検索を(特にクロスプラットフォームで)必要とするほとんどのアプリケーションに適している技術です。※ 公式サイトから抜粋 インデックスの作成 lucene は転置インデックス型の検索エンジンなので、ドキュメントを検索するには、まずインデックスの作
今回のゲストは、世界最大級の動画コンテンツの検索を可能とした、動画検索サービスFoooooの運営会社 株式会社バンク・オブ・イノベーションの樋口社長と田中取締役です。バンク・オブ・イノベーションは20代の3人の創業者が2006年に設立したまだ若いベンチャーです。動画検索自体が新しい分野のサービスですが、今後どのような見通しをもたれているのか、詳しく伺いました。 樋口 智裕(ひぐち ともひろ) 株式会社バンク・オブ・イノベーション 代表取締役 1983年1月15日生。青山学院大学経営学部卒。在学中から創業メンバーとして学生ベンチャーに参加。その後独立し弊社を創業。Webシステム開発経験多数。主任開発者。 田中 大介(たなか だいすけ) 株式会社バンク・オブ・イノベーション 取締役 1983年9月20日生。東京大学経済学部卒。在学中から創業メンバーとして学生ベンチャーに参加。その後独立しフリー
前々回の記事「百度、本気で日本の検索エンジン市場に参入する けど」の本文中で、Googleの検索結果が同じキーワードでも朝と夜で変化するという話を書きましたが、それについて説明している日本語の記事があまりないので、ここで解説をしておきます。この技術はもともと、米New York TimesのGoogleへのインタビューの中で紹介されたもので、QDF(query deserves freshness)と呼ばれるものです。日本国内では2007年4月以降、Googleウェブ検索によく「5分前」「1時間前」「4時間前」といったラベルつきのリンクが掲載されることがありますが、これはQDFアルゴリズムによるものです。 --------------- GoogleやYahoo!で検索した時に私たちが目にする検索結果の並び順というのは、ある時点におけるウェブページのランク付けの結果に基づいたものだ。ウェブ
Web Images Mp3/Audio Video Directory News People
リリース、障害情報などのサービスのお知らせ
最新の人気エントリーの配信
処理を実行中です
j次のブックマーク
k前のブックマーク
lあとで読む
eコメント一覧を開く
oページを開く