国立情報学研究所(NII)が2026年4月3日に公開した LLM-jp-4 シリーズの技術的な深掘り解説。
Mac mini M4 / Ollama 環境への導入手順と、PPQAT・RAG用途での活用戦略をまとめる。
日本語の割合が全体の約3.6%にもかかわらず日本語性能でGPT-4oを上回れた設計思想がここにある。英語の大量学習で汎用的な推論能力を獲得した上で、中間学習で日本語の指示理解力を底上げし、さらにSFTで精密なチューニングを行う多段構成。
コーパスの内訳には、インターネット上の公開データ、政府・国会の文書、合成データが含まれる。OSAID(オープンソースAIの定義)に配慮し、すべて第三者が入手可能なデータで構成されている点が大きな特徴。コーパス構築スクリプトもGitLabで公開されている。
Hugging Face Transformers 経由が最もシンプルな導入方法。公式cookbookも提供されている。
bash # 依存関係 pip install torch transformers accelerate flash-attn
python import torch from transformers import AutoModelForCausalLM, AutoTokenizer model_name = "llm-jp/llm-jp-4-8b-thinking" tokenizer = AutoTokenizer.from_pretrained( model_name, trust_remote_code=True # カスタムトークナイザー用 ) model = AutoModelForCausalLM.from_pretrained( model_name, device_map="auto", torch_dtype=torch.bfloat16 ) chat = [ {"role": "user", "content": "半導体製造プロセスの特許出願における進歩性の判断基準を説明してください"} ] inputs = tokenizer.apply_chat_template( chat, add_generation_prompt=True, tokenize=True, return_tensors="pt" ).to(model.device) with torch.no_grad(): output = model.generate( inputs, max_new_tokens=512, do_sample=True, top_p=0.95, temperature=0.7 ) print(tokenizer.decode(output[0], skip_special_tokens=True))
llm-jp/llm-jp-4-8b-thinking — 8B instruct済み(推奨)llm-jp/llm-jp-4-32b-a3b-thinking — 32B-A3B instruct済みllm-jp/llm-jp-4-8b-base — 8B 事前学習済み(ベースモデル)llm-jp/llm-jp-4-32b-a3b-base — 32B-A3B ベースモデル
Ollama公式レジストリには未登録のため、GGUF変換→カスタムモデル登録の手順が必要。
bash git clone https://github.com/ggerganov/llama.cpp cd llama.cpp && make -j
bash pip install huggingface_hub huggingface-cli download llm-jp/llm-jp-4-8b-thinking \ --local-dir ./llm-jp-4-8b
32B-A3Bの場合は llm-jp/llm-jp-4-32b-a3b-thinking に変更
bash python3 convert_hf_to_gguf.py ./llm-jp-4-8b \ --outfile llm-jp-4-8b-q4_k_m.gguf \ --outtype q4_k_m
品質重視なら q8_0(~9GB)、軽量化なら q4_k_m(~5GB)を選択
Modelfile FROM ./llm-jp-4-8b-q4_k_m.gguf PARAMETER temperature 0.7 PARAMETER num_ctx 8192 PARAMETER top_p 0.95 SYSTEM "あなたは知財戦略を支援するAIアシスタントです。 特許分析、FTO調査、IP戦略の策定を正確かつ丁寧に行います。"
bash ollama create llm-jp-4-8b -f Modelfile ollama run llm-jp-4-8b # 動作確認 ollama run llm-jp-4-8b "特許法104条の3について要約してください"
Mac mini M4 で Ollama サーバーとして起動し、Tailscale VPN 経由で他マシンからアクセスする構成。
bash # ⚠ 0.0.0.0 バインド禁止(セキュリティルール) # Tailscale内部IPまたはlocalhostのみ OLLAMA_HOST=127.0.0.1:11434 ollama serve
bash # 他マシンからTailscale IP経由でアクセス curl http://<tailscale-ip>:11434/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "llm-jp-4-8b", "messages": [ {"role": "user", "content": "半導体製造装置のFTOリスクを分析してください"} ] }'
127.0.0.1 または Tailscale IP のみでバインド。
ハードコードされたトークン禁止。環境変数での管理を徹底すること。
日本語の特許文書解析
JPO審査基準の参照・要約
技術記事の下書き
公的機関の報告書の要約
政府・法務文書の理解
英語特許・論文の読解
多言語コード生成
汎用的な推論タスク
数学・ロジック系の処理
パラメータ数の優位性が活きる場面
| タスク | 推奨モデル | 理由 |
|---|---|---|
| PPQAT Devil's Advocate | llm-jp-4 | 日本語の法律・制度文書の理解精度 |
| FTO先行技術調査の要約 | llm-jp-4 | 特許明細書の日本語表現に強い |
| File Wrapper分析 | qwen3 | USPTO英語文書がメイン |
| PIDB RAG検索 | 両方 | 言語に応じてルーティング |
| コード生成・MCP構築 | qwen3 | コード学習データ比率の優位性 |
| note.com記事の下書き | llm-jp-4 | 自然な日本語生成 |
NIIは2026年度中に以下のモデルを順次公開予定:
OSAID(オープンソースAIの定義)に配慮し、すべて第三者が入手可能なデータで学習している。 コーパス構築スクリプトもGitLabで公開。 特許業務や企業内RAGで「学習データの出所が不透明」という懸念を排除できるのは大きな利点。
SEP戦略を進める企業にとって、AIインフラ自体の透明性・説明可能性を確保できることは、 クライアントや規制当局に対するリスクヘッジにもなる。