Lab / 検証レポート

「使えるか」を、実際に検証して公開する

生成AIを実務に入れられるかは、試してみないと分かりません。同一プロンプト・複数試行・採点キー先出しという同じ型で検証し、うまくいかなかったケースも含めてそのまま公開しています。

Series 01

ローカルLLMの実務適用

インターネットに接続しない閉域環境で、ローカルLLMが業務にどこまで耐えるか。 タスクを変えながら同じ型で検証し、うまくいかなかったケースも含めて公開しています。

検証環境

シリーズ01 共通

ローカル実行環境AWS EC2 g6e.xlarge / NVIDIA L40S ×1(VRAM 48GB)/ Ubuntu 22.04 Deep Learning AMI
推論Ollama(既定の Q4_K_M 量子化)
検証対象モデルQwen3 32B / 14B / 8B、Llama3.1 8B、Gemma3 12B、Phi-4 14B、Swallow 8B、ELYZA JP 8B
基準線Claude Sonnet 5(AWS Bedrock)。GPUスペックは非公開のため、応答時間はローカルLLMと同列比較しない
入力データ原則すべて架空データ。検証08のみ自社サイトの実データを使用

検証ケース

総合評価は各ケースの採点キーに基づく。◎ ほぼ完全/○ 軽微な誤り/△ 複数の欠陥/× 実務利用に支障

CASE 01

議事メモ整理

会議の文字起こし → サマリー+ToDo表

Qwen3 32B / 14B / 8B + Sonnet 5
2026/07・n=1

△ 8B(3サイズ中最良)
公開中

CASE 02

資料要約

日本語の戦略資料(PDF)→ 要約。入力が社内資料のため公開範囲を限定

Qwen3 32B / 14B / 8B・minimax-m3 + Sonnet 5
2026/07・n=1

◎ 14B(21.5秒)
部分公開

CASE 03

アクセス解析インサイト

GA4データ → 解析インサイトレポート

Qwen3 32B / 14B / 8B + Sonnet 5
2026/08・n=3

△ 32B(3回中1回のみ正確)
公開中

CASE 04

英日翻訳

英語マーケティング文書 → 日本語

Qwen3 32B / 14B / 8B + Sonnet 5
2026/08・n=3

△ 14B(後編集前提なら実用圏)
公開中

CASE 05

飲食店の月次レポート

日次売上 → 集計+改善インサイト(条件A/B比較)

Qwen3 32B / 14B / 8B + Sonnet 5
2026/08・n=3

◎ 32B(条件B・18/19)
公開中

CASE 06

経費レポート

集計プログラムとLLMの境界設計(設計編)

Qwen3 32B / 14B / 8B + Sonnet 5
設計のみ


設計公開中

CASE 07

EC年間レポート

8モデル横断比較(日本語特化モデル含む)

Qwen3 3サイズ・Llama3.1・Gemma3・Phi4・Swallow・ELYZA + Sonnet 5
2026/08・n=3

△ 32B(群B 1.7)
公開中

CASE 08

サイトQAチャットボット

自社サイトの情報を参照して質問に回答(9モデル横断)

Qwen3 3サイズ・Llama3.1・Gemma3・Phi4・Swallow・ELYZA + Sonnet 5
2026/08・n=3

◎ 8モデルが45/45
公開中

CASE 09

PDF資料の情報抽出

PowerPoint由来PDF → 抽出+サマリー(4条件比較)

Qwen3 3サイズ・Llama3.1・Gemma3・Phi4・Swallow・ELYZA + Sonnet 5
2026/08・n=3

◎ 正規化すれば5モデルが33/33
公開中

Upcoming

今後の検証テーマ

シリーズ01の残りケースに加えて、ローカルLLM以外のテーマも同じ型で検証していきます。 検証してほしいテーマのご要望も受け付けています。

01

レビューからのインサイト抽出

  • レビューにない主張をどこまで創作するか。抽出したインサイトを根拠に紐付けられるか。

02

手書きメモの文字起こし

  • 誤読・脱字・レイアウト解釈の精度。画像入力に対応したモデルが前提。

03

プロンプト改善で直るか

  • 検証で見つけた欠陥が、プロンプトの一行追加で解決するのか、モデル能力の限界なのか。

生成系AI活用、DX推進についてご相談ください

レビュー分析やインサイト生成、戦略支援など、生成系AIの活用やDX推進について幅広く支援いたします。

お問い合わせ