model1 = """ CREATE OR REPLACE MODEL `my-example-housing-dataset.ameshousing.linearmodel` OPTIONS(model_type='linear_reg', ls_init_learn_rate=.15, l1_reg=1, max_iterations=5) AS SELECT IFNULL(SalePrice, 0) AS label, IFNULL(GrLivArea, 0) AS LivingAreaSize, YearBuilt, OverallCond, OverallQual FROM `my-example-housing-dataset.ameshousing.train` """
model1 = """
CREATE OR REPLACE MODEL
`my-example-housing-dataset.ameshousing.linearmodel`
OPTIONS(model_type='linear_reg', ls_init_learn_rate=.15, l1_reg=1, max_iterations=5) AS
SELECT
IFNULL(SalePrice, 0) AS label,
IFNULL(GrLivArea, 0) AS LivingAreaSize,
YearBuilt,
OverallCond,
OverallQual
FROM
`my-example-housing-dataset.ameshousing.train`
"""
「Google は、NOAA のデータを GCP の BigQuery などのツールと統合することで、科学データ フォーマットの理解や分析データの準備に関連する多くの障害を効果的に解消し、一般のユーザーによる NOAA データの利用拡大に貢献しています。Google サービスを一定の制限付きで手軽に、そして無料で利用できるサブスクリプションの導入も、データ分析の敷居を下げています。」― NOAA の最高データ責任者、Ed Kearns 氏
「BigQuery サンドボックスのおかげで、数千の Firebase プロジェクトでアプリケーションの使用状況の把握や、クラッシュが発生したコンテキストの分析、リリース候補の評価が的確にできるようになっています。こうしたことが有意義な判断につながっています。」― Firebase のテクニカル リード マネージャー、Eugene Girard
BigQuery、Google Cloud Storage、など
事業者向け間接資材のオンライン通販サイト「モノタロウ」を運営する E コマース企業。2000 年 10 月に住友商事と米国グレンジャー社の出資により設立され、わずか 5 年弱で登録事業所数 10 万件を突破。2018 年 9 月末時点で、登録ユーザー数約 308 万人、取り扱い商品点数は 1,700 万点。現在は中国市場にも進出しているほか、大企業向け間接資材(MRO)集中購買サービスも展開中。
BigQuery、Google Cloud Storage、Google Cloud Machine Learning Engine、Cloud Auto ML、Cloud Dataflow、Cloud Datalab、Google Cloud Interconnect など
法人向けの事務用品通販サービス(個人向けにも「LOHACO」という名称で EC サービスを展開中)。全国に 9 か所の物流センターを構えることで、都市部では注文当日、翌日の配送を実現している(社名の由来は「明日来る」から)。従業員数は連結子会社含め 3,200 名。EC サイトから物流までの全工程を独自に運用している。
BigQuery、Stackdriver Logging、Cloud Pub/Sub、Cloud Dataflow、 Google Cloud Storage など
恋愛・婚活マッチング サービス「Pairs」および、カップル向けコミュニケーション アプリ「Couples」の開発・運営を行う事業会社。「Pairs」の会員数は 2018 年 2 月時点で約 700 万人(日本・台湾・韓国合計)、マッチング数は 5,600 万組を突破しています。2015 年、オンライン デーティングサービスをグローバル展開する IAC / Match Group に参加し、今後は東南アジアを中心にサービスを拡大していく予定。社としてのモットーは「全ての人が人生に可能性を開いていける世界を作る」。従業員数は 130 名(アルバイト含む)。
1) データの取り込みの手法、制約 BigQuery にデータを取り込むベストプラクティスです。どのようなデータソースから取り込むことが可能なのか、取り込み方の基本的なパターン(Data Loading と Streaming Insert)、さらに大規模データの取り込みの注意点を解説します。データの取り込みを素早く行うためのヒントを学びましょう。 2) マスタデータの更新 マスターデータ更新のベストプラクティスを紹介します。手法としては3つの選択肢があります。 BigQuery のテーブルをdelete して再度ロード、Data Loading を利用して追加する、DML で更新する方法です。 3) 外部データソースの解析 BigQuery 自身のストレージではない場所に格納されたデータをクエリできる機能です。実行速度はネイティブ実行よりも遅くなりますが、Google Cloud Storage、Google ドライブなどを対象ソースとしているので用途も幅広く、便利な機能です。 4) パフォーマンスの最適化 クエリの実行を高速化するヒントを解説します。カラム指向という特長を活かしたクエリを行う、データを非正規化する、キャッシュの利用、中間テーブルを作成するといったことで、最適なパフォーマンスでのデータ分析が可能となります。
「BigQueryは、当行のデータアナリティストやデータ解析・分析者の働き方を変える一つのドライバーになり得るものです。現在、オンプレミスで構成された分析用 DWH 環境で、SQLでクエリを実行しているものの、処理リソースの上限があることから処理時間が長時間化しているという課題を抱えていました。以前から、これをクラウド化したいと考えていましたが、今回、東京 GCP リージョンでの BigQuery 使用が可能となったことで、当行が定めるセキュリティ要件を満たす形で実証実験を実施しました。実証実験には、実際に業務で使用するデータを利用し、実業務での活用を見据えた形で構成しています。BigQuery を活用することで、処理リソースの上限を気にすることなく、処理タスクを集約・並列し、多重処理することが可能になります。これにより、複数部門に渡るデータ分析者の業務時間が短縮・効率化され、企画立案や分析結果からの洞察・推察を導くための時間を増やすことに繋がると期待しています。現行よりもコストを抑制することができるのに加え、BigQuery には連携された使い易いサービスが用意されています。Dataprep や Data Studio というデータ処理、可視化機能を BigQueryと共に活用することで、クラウド上での分析業務を一気通貫で進めることが可能になることを今回の検証で確認できたことは大きな収穫となりました。」
-- みずほ銀行 個人マーケティング推進部 参事役 シニアマネージャー 黒須義一 氏
「東京 GCP リージョンでの BigQuery の提供を歓迎します。弊社は、企業向けクラウドサービス「Enterprise Cloud」において以前より BigQuery を活用し、ネットワークやサーバーの異常検知・分析を行っています。今回、東京 GCP リージョンでの BigQuery 実証実験では、世界 9 拠点からリアルタイムにストリーミングされる大規模なログデータ(累計 278 億件)を用いて評価を実施しました。データ分析基盤には、機器やソフトウェアが生成する大量のログデータがリアルタイムに反映され、かつ、過去データまで含めた超高速の分析と出力が可能なスピードとパワーが求められます。BigQuery は、高いコストパフォーマンスで緊急時でも高速のレスポンスを実現し、既存の DWH では不可能だった大規模なログデータの利活用を可能にします。今後も、 BigQuery をはじめとした GCP のサービスとの連携を強化し、お客さまのセキュアなデータ活用を支援するクラウドソリューションの提供に向けて取り組んでまいります。」
-- エヌ・ティ・ティ・コミュニケーションズ株式会社 取締役クラウドサービス部長 森林正彰氏
「エンタープライズ企業の基幹システムで蓄積してきたデータを活用する、プライベート DMP などで BigQuery を利用しております。今回 BigQuery が東京リージョンでサポートされ、日本国内に閉じたデータ配置が可能となりました。また、BigQuery は Interconnect や VPC Service Control と組み合わせると、オンプレミス環境からパブリックなネットワークを介さない閉域接続が可能です。東京リージョンの BigQuery を活用することで、データの配置場所や通信経路に関して制約があるお客様についてもクラウド上でのデータ分析基盤の構築を積極的に提案することが可能になりました。」
-- 株式会社野村総合研究所 基盤インテグレーション推進部 システムエンジニア 小島仁志氏
SELECT sum(numBytes) FROM `YOUR-PROJECT-ID.bigquery_views.table_metadata_v1_0`
SELECT count(*) FROM `YOUR-PROJECT-ID.bigquery_views.table_metadata_v1_0`SELECT count(*) FROM `YOUR-PROJECT-ID.bigquery_views.partition_metadata_v1_0`
SELECT projectId, datasetId, sum(numBytes) as totalNumBytesFROM `YOUR-PROJECT-ID.bigquery_views.table_metadata_v1_0`GROUP BY projectId, datasetId ORDER BY totalNumBytes DESC LIMIT 100
SELECT projectId, datasetId, tableId, numBytesFROM `YOUR-PROJECT-ID.bigquery_views.table_metadata_v1_0`sORDER BY numBytes DESC LIMIT 100
SELECT projectId, datasetId, tableId, partitionId, numBytes FROM `YOUR-PROJECT-ID.bigquery_views.partition_metadata_v1_0`ORDER BY numBytes DESC LIMIT 100