タグ

GPUとDeepSeekに関するmkusakaのブックマーク (1)

  • 「DeepSeek-OCR」を試す

    実運用の強さ:少トークンでSOTA級に迫る OmniDocBenchで比較するとさ、 Small(100トークン) で既にGOT-OCR2.0(256トークン)を超えがちだし。 Large(400, 有効285トークン) でSOTAと肩並べる感じ。 Gundam(<800トークン)でMinerU2.0(約6790トークン) より優秀。コスパ良すぎでしょ。 カテゴリ別の肌感: スライドは64トークンで十分。 ・レポートは100トークンで良。 新聞はテキスト密度高すぎなのでGundam以上が欲しい。 なんでこんなに軽いの? ウィンドウ注意+16×圧縮+グローバル注意の直列デザインがマジ効いてる。 前段で大量パッチを安く見て、中間でトークンをギュッと圧縮してから、後段でリッチに解釈。 GPUメモリのアクティベーション低め、トークン数少なめ、多解像度対応で、訓練も推論も扱いやすい。 具体的にでき

    「DeepSeek-OCR」を試す
    mkusaka
    mkusaka 2025/10/22
    DeepSeek-OCR(3B/MIT)をColab L4で検証。PDF→画像化しMarkdown/表/画像抽出やVRAM約15GBを記録。
  • 1