01
レビューからのインサイト抽出
- レビューにない主張をどこまで創作するか。抽出したインサイトを根拠に紐付けられるか。
Lab / 検証レポート
生成AIを実務に入れられるかは、試してみないと分かりません。同一プロンプト・複数試行・採点キー先出しという同じ型で検証し、うまくいかなかったケースも含めてそのまま公開しています。
Series 01
インターネットに接続しない閉域環境で、ローカルLLMが業務にどこまで耐えるか。 タスクを変えながら同じ型で検証し、うまくいかなかったケースも含めて公開しています。
シリーズ01 共通
| ローカル実行環境 | AWS EC2 g6e.xlarge / NVIDIA L40S ×1(VRAM 48GB)/ Ubuntu 22.04 Deep Learning AMI |
|---|---|
| 推論 | Ollama(既定の Q4_K_M 量子化) |
| 検証対象モデル | Qwen3 32B / 14B / 8B、Llama3.1 8B、Gemma3 12B、Phi-4 14B、Swallow 8B、ELYZA JP 8B |
| 基準線 | Claude Sonnet 5(AWS Bedrock)。GPUスペックは非公開のため、応答時間はローカルLLMと同列比較しない |
| 入力データ | 原則すべて架空データ。検証08のみ自社サイトの実データを使用 |
総合評価は各ケースの採点キーに基づく。◎ ほぼ完全/○ 軽微な誤り/△ 複数の欠陥/× 実務利用に支障
CASE 01
会議の文字起こし → サマリー+ToDo表
Qwen3 32B / 14B / 8B + Sonnet 5
2026/07・n=1
△ 8B(3サイズ中最良)
公開中
CASE 02
日本語の戦略資料(PDF)→ 要約。入力が社内資料のため公開範囲を限定
Qwen3 32B / 14B / 8B・minimax-m3 + Sonnet 5
2026/07・n=1
◎ 14B(21.5秒)
部分公開
CASE 03
GA4データ → 解析インサイトレポート
Qwen3 32B / 14B / 8B + Sonnet 5
2026/08・n=3
△ 32B(3回中1回のみ正確)
公開中
CASE 04
英語マーケティング文書 → 日本語
Qwen3 32B / 14B / 8B + Sonnet 5
2026/08・n=3
△ 14B(後編集前提なら実用圏)
公開中
CASE 05
日次売上 → 集計+改善インサイト(条件A/B比較)
Qwen3 32B / 14B / 8B + Sonnet 5
2026/08・n=3
◎ 32B(条件B・18/19)
公開中
CASE 06
集計プログラムとLLMの境界設計(設計編)
Qwen3 32B / 14B / 8B + Sonnet 5
設計のみ
—
設計公開中
CASE 07
8モデル横断比較(日本語特化モデル含む)
Qwen3 3サイズ・Llama3.1・Gemma3・Phi4・Swallow・ELYZA + Sonnet 5
2026/08・n=3
△ 32B(群B 1.7)
公開中
CASE 08
自社サイトの情報を参照して質問に回答(9モデル横断)
Qwen3 3サイズ・Llama3.1・Gemma3・Phi4・Swallow・ELYZA + Sonnet 5
2026/08・n=3
◎ 8モデルが45/45
公開中
CASE 09
PowerPoint由来PDF → 抽出+サマリー(4条件比較)
Qwen3 3サイズ・Llama3.1・Gemma3・Phi4・Swallow・ELYZA + Sonnet 5
2026/08・n=3
◎ 正規化すれば5モデルが33/33
公開中
CASE 10
社内規程集 → 全文投入 vs RAG3方式 vs 検索が完璧な場合(5条件比較)
Qwen3 3サイズ・Llama3.1・Gemma3・Phi4・Swallow・ELYZA + Sonnet 5
2026/08・n=3
◎ RAGなら5モデルが満点
公開中
CASE 11
検証01と同じ会議メモで、Qwen3の次世代 qwen3.8:27b を含む10モデルを比較
qwen3.8:27b・Qwen3 3サイズ・Llama3.1・Gemma3・Phi4・Swallow・ELYZA + Sonnet 5
2026/08・n=3
◎ qwen3.8:27b が22/22・ばらつき0
公開中
Upcoming
シリーズ01の残りケースに加えて、ローカルLLM以外のテーマも同じ型で検証していきます。 検証してほしいテーマのご要望も受け付けています。
01
02
03