🏠 ホーム 📖 解説記事 📚 トピック解説 🏷️ タグ一覧 ℹ️ About
ツール
💰 API料金計算機 NEW
🔍 記事を検索
カテゴリ
📡 RSSフィード
Follow
X (Twitter) 🧵 Threads

LLM(大規模言語モデル)

ローカルLLM実行・推論最適化・モデル比較を用途別に整理。

28件のツール・リソース
LLMをローカルで動かす・APIで提供する・最適化するためのOSSが急速に充実している。量子化・推論サーバー・モデル管理を組み合わせれば、クラウドAPIに頼らずに高性能なLLM環境を構築できる。コスト削減・プライバシー保護・レイテンシ改善など、ローカル実行のメリットは大きい。
実行環境
GPU・CPU・Apple Siliconなど対応ハードウェア
推論速度
量子化・バッチ処理・KVキャッシュで高速化
メモリ効率
GGUF・GPTQ・AWQなど量子化形式の選択
モデルサイズ
1Bから70B+まで用途に応じたサイズ選定

ローカル実行・推論最適化

LLMのローカル実行・量子化・推論サーバー構築

KTransformers解説|24GB VRAMでDeepSeek-R1級MoEを動かすCPU/GPUヘテロ推論
2026.07.23
KTransformers解説|24GB VRAMでDeepSeek-R1級MoEを動かすCPU/GPUヘテロ推論
KTransformers(kvcache-ai・★18,900超・Apache-2.0)は、MoEの専門家をCPUへ、注意層とKVキャッシュをGPUへ置くCPU/GPUヘテロ推論フレームワーク。DeepSeek-R1/V3級の巨大MoEを単一24GB VRAM+大容量RAMで動かす仕組みを、他ランタイムとの違いとともに一次情報で整理する。
omlx徹底解説|Apple Silicon専用・OpenAI/Anthropic両対応のローカルLLMサーバーを実測
2026.07.19
omlx徹底解説|Apple Silicon専用・OpenAI/Anthropic両対応のローカルLLMサーバーを実測
omlx(jundot/omlx・★17,900超・Apache-2.0)はApple Silicon専用のローカルLLM推論サーバー。OpenAIとAnthropicの両API互換で、Claude Codeのローカルバックエンドになる。M2 Mac(macOS 14.5)で実際に起動し、両エンドポイントとKVキャッシュの効きを実測した。
llmfit完全ガイド:今のPCで動くローカルLLMを1コマンドで判定するツール
2026.07.13
llmfit完全ガイド:今のPCで動くローカルLLMを1コマンドで判定するツール
AlexsJones/llmfitは、GPU・VRAM・RAMを検出して『今の自分のPCで動くローカルLLM』を1コマンドで判定するRust製のCLI/TUIツール。★29,000超。仕組み、Ollama・LM Studioとの使い分け、マシン別のおすすめモデルまで公式情報をもとに完全解説します。
Ollama API完全ガイド2026|REST・OpenAI互換・Python/JSでローカルLLMを叩く
2026.07.06
Ollama API完全ガイド2026|REST・OpenAI互換・Python/JSでローカルLLMを叩く
Ollama APIは、ローカルで動くLLMをHTTPで叩くためのREST API。/api/generate・/api/chatのネイティブAPIと、/v1のOpenAI互換APIの両方を既定ポート11434で公開する。エンドポイント全体像、ストリーミング、構造化出力、keep_alive、Python/JSからの呼び出し、公開設定の注意点まで公式ドキュメントを基に解説する。
GLM-5.2 使い方・解説|Z.aiの744B MoEオープンモデルをローカル運用+ベンチ比較
2026.06.17
GLM-5.2 使い方・解説|Z.aiの744B MoEオープンモデルをローカル運用+ベンチ比較
Z.ai(智谱AI)が公開したGLM-5.2の使い方と実力を、Hugging Faceモデルカードの公式情報で解説。744B MoE・1Mコンテキスト・MITライセンス、公称ベンチマーク、ローカル運用のVRAM要件とAPI利用までを一次ソースで確認。DeepSeek・Qwen・Claudeとの比較表付き。
VoxCPM2|トークナイザレス多言語TTSをローカルで動かす(音色設計・クローニング対応)
2026.06.04
VoxCPM2|トークナイザレス多言語TTSをローカルで動かす(音色設計・クローニング対応)
VoxCPM2はOpenBMBのトークナイザレス多言語TTS。Apache-2.0・約25,576★で日本語含む30言語に対応し、テキスト記述からの音色設計とゼロショットボイスクローニングをローカルで動かせる。設計・性能・実行手順・倫理を一次ソースで整理する。
Codex CLIをOllamaでローカル実行2026|API課金もレート制限もないgpt-oss開発環境
2026.05.16
Codex CLIをOllamaでローカル実行2026|API課金もレート制限もないgpt-oss開発環境
Codex CLIをOllamaでローカル実行する2026年版ガイド。Ollama 0.24の『ollama launch codex』一発でgpt-oss等のOSSモデルにつなぎ、API課金もレート制限もなくOpenAI公式コーディングエージェントが動く。config.tomlプロファイルとCodex Appも解説。
DFlash徹底解説|vLLM/SGLangで最大6倍高速化するブロック拡散ドラフトモデル
2026.05.07
DFlash徹底解説|vLLM/SGLangで最大6倍高速化するブロック拡散ドラフトモデル
Z LabがリリースしたDFlashはブロック拡散モデルでドラフトトークンを並列生成する投機的デコーディング新手法。Qwen3-8BでlosslessでEAGLE-3比2.5倍・最大6倍の高速化を達成。vLLM mainline/SGLang/Transformers/MLX対応で即実用可能。
OpenOats:会議音声をローカルで転記しLLMと対話できるツール
2026.03.26
OpenOats:会議音声をローカルで転記しLLMと対話できるツール
会議音声をMac上で完全ローカル転記し、Claude・GPT-4oなどのLLMで内容を検索・対話できるOSSツール。プライバシーを守りながら議事録作成を効率化しよう。概要 OpenOatsは、会議やミーティングの音声を自動で転記し、記録された内容をAIが対話的に検索・参照できるツール。従来型の手書きメモやテキスト議…
Distributed Llama:家庭用デバイスを繋ぐだけでLLMローカル実行を高速化する分散フレームワーク
2026.03.24
Distributed Llama:家庭用デバイスを繋ぐだけでLLMローカル実行を高速化する分散フレームワーク
家にある複数のPCやRaspberry PiをLANで繋ぎ、テンソル並列処理でLLMローカル実行を高速化するC++製フレームワーク。Llama・Qwen3・DeepSeekに対応し、月3万円のAPIコストをゼロにした実績あり。今すぐ試せるインストール手順付きで解説します。
BitNet|Microsoftの1ビットLLM量子化フレームワーク — CPUだけで100Bモデルが動く仕組み
2026.03.24
BitNet|Microsoftの1ビットLLM量子化フレームワーク — CPUだけで100Bモデルが動く仕組み
Microsoftの1ビット量子化技術でLLMのメモリ使用量を90%削減し、エッジデバイスやスマートフォンでも高速なLLMローカル実行を実現する公式フレームワーク。CPUだけで100Bパラメータモデルが動く仕組みとインストール手順を徹底解説。
ClaraVerse:LLMローカル実行対応のプライバシー重視プライベートAIプラットフォーム完全ガイド
2026.03.23
ClaraVerse:LLMローカル実行対応のプライバシー重視プライベートAIプラットフォーム完全ガイド
ClaraVerseはChatGPT・Claudeをセルフホストし、データを外部送信せずLLMローカル実行できるオープンソースプラットフォームです。マルチモーダル対応、N8N互換ワークフロー、iOS/Androidアプリを統合。Docker導入手順やコード例を詳しく解説します。

応用・統合

チャットUI・APIゲートウェイ・マルチモデルルーティング

GLM-Skills:AIエージェント向け30以上のスキルを統合公開したOSS
2026.04.02
GLM-Skills:AIエージェント向け30以上のスキルを統合公開したOSS
Zhipu AI公式のGLMスキル集がオープンソース化。画像キャプション・PDF変換・株式分析・コード生成など30以上のスキルをClaude Code・OpenCode・OpenClawから即座に利用可能。導入手順と各スキルの活用例を今すぐ確認しよう。
SpatialLM:空間情報を言語モデルに統合する研究フレームワーク
2026.03.31
SpatialLM:空間情報を言語モデルに統合する研究フレームワーク
地理的座標や空間関係を大規模言語モデルに組み込むための研究基盤。空間推論能力を備えたAIシステムの構築を支援。GitHubで公開中、4424スター獲得。概要 SpatialLMは、大規模言語モデルに3D空間認識能力を統合するための研究フレームワーク。ポイントクラウド(点群データ)の処理と自然言語を組み合わせた空間理…

用途別おすすめ

ローカルでLLMを試したい → Ollamaでワンコマンド実行が最短。Apple Silicon Macなら特に相性が良い。「ローカル実行・推論最適化」セクションを参照。
本番APIサーバーを立てたい → vLLMのOpenAI互換APIサーバーが定番。高スループットが必要なら推論最適化ツールも併用。
複数モデルを切り替えたい → 「応用・統合」セクションのAPIゲートウェイ・ルーターで統一エンドポイントを構築。
モデルの性能を比較したい → 「モデル管理・評価」セクションのベンチマークツールで定量評価。用途に合ったモデル選定ができる。

すべてのツール

新着順に全28件を表示

KTransformers解説|24GB VRAMでDeepSeek-R1級MoEを動かすCPU/GPUヘテロ推論
2026.07.23
KTransformers解説|24GB VRAMでDeepSeek-R1級MoEを動かすCPU/GPUヘテロ推論
KTransformers(kvcache-ai・★18,900超・Apache-2.0)は、MoEの専門家をCPUへ、注意層とKVキャッシュをGPUへ置くCPU/GPUヘテロ推論フレームワーク。DeepSeek-R1/V3級の巨大MoEを単一24GB VRAM+大容量RAMで動かす仕組みを、他ランタイムとの違いとともに一次情報で整理する。
omlx徹底解説|Apple Silicon専用・OpenAI/Anthropic両対応のローカルLLMサーバーを実測
2026.07.19
omlx徹底解説|Apple Silicon専用・OpenAI/Anthropic両対応のローカルLLMサーバーを実測
omlx(jundot/omlx・★17,900超・Apache-2.0)はApple Silicon専用のローカルLLM推論サーバー。OpenAIとAnthropicの両API互換で、Claude Codeのローカルバックエンドになる。M2 Mac(macOS 14.5)で実際に起動し、両エンドポイントとKVキャッシュの効きを実測した。
llmfit完全ガイド:今のPCで動くローカルLLMを1コマンドで判定するツール
2026.07.13
llmfit完全ガイド:今のPCで動くローカルLLMを1コマンドで判定するツール
AlexsJones/llmfitは、GPU・VRAM・RAMを検出して『今の自分のPCで動くローカルLLM』を1コマンドで判定するRust製のCLI/TUIツール。★29,000超。仕組み、Ollama・LM Studioとの使い分け、マシン別のおすすめモデルまで公式情報をもとに完全解説します。
Ollama API完全ガイド2026|REST・OpenAI互換・Python/JSでローカルLLMを叩く
2026.07.06
Ollama API完全ガイド2026|REST・OpenAI互換・Python/JSでローカルLLMを叩く
Ollama APIは、ローカルで動くLLMをHTTPで叩くためのREST API。/api/generate・/api/chatのネイティブAPIと、/v1のOpenAI互換APIの両方を既定ポート11434で公開する。エンドポイント全体像、ストリーミング、構造化出力、keep_alive、Python/JSからの呼び出し、公開設定の注意点まで公式ドキュメントを基に解説する。
GLM-5.2 使い方・解説|Z.aiの744B MoEオープンモデルをローカル運用+ベンチ比較
2026.06.17
GLM-5.2 使い方・解説|Z.aiの744B MoEオープンモデルをローカル運用+ベンチ比較
Z.ai(智谱AI)が公開したGLM-5.2の使い方と実力を、Hugging Faceモデルカードの公式情報で解説。744B MoE・1Mコンテキスト・MITライセンス、公称ベンチマーク、ローカル運用のVRAM要件とAPI利用までを一次ソースで確認。DeepSeek・Qwen・Claudeとの比較表付き。
VoxCPM2|トークナイザレス多言語TTSをローカルで動かす(音色設計・クローニング対応)
2026.06.04
VoxCPM2|トークナイザレス多言語TTSをローカルで動かす(音色設計・クローニング対応)
VoxCPM2はOpenBMBのトークナイザレス多言語TTS。Apache-2.0・約25,576★で日本語含む30言語に対応し、テキスト記述からの音色設計とゼロショットボイスクローニングをローカルで動かせる。設計・性能・実行手順・倫理を一次ソースで整理する。
Headroom|LLMプロンプトを60〜95%圧縮しトークンを削減するOSSミドルウェアの仕組みと使い方
2026.06.04
Headroom|LLMプロンプトを60〜95%圧縮しトークンを削減するOSSミドルウェアの仕組みと使い方
Headroomはツール出力・ログ・RAGチャンクをLLMに渡す前に60〜95%圧縮するApache 2.0のプロンプト圧縮ミドルウェア。トークンコスト削減とRAG精度維持を両立する仕組み、CCR可逆圧縮、出力トークン削減、LLMLinguaとの違い、使い方、コスト試算まで一次ソースで整理する。
Gemma 4 12B|エンコーダレス・マルチモーダルで256K文脈を16GBノートで動かすオープンモデル
2026.06.04
Gemma 4 12B|エンコーダレス・マルチモーダルで256K文脈を16GBノートで動かすオープンモデル
Gemma 4 12BはGoogle DeepMindが2026年6月3日公開したApache 2.0のオープンモデル。Vision・Audioのエンコーダを廃し線形射影でLLMへ直送、256K文脈を16GBノートで動かす。アーキ・ベンチ・ローカル実行・落とし穴を一次ソースで整理する。
MiniMax M3|SWE-Bench Pro 59.0%のオープンウェイトモデルをMSAアーキ・1M文脈で読み解く
2026.06.03
MiniMax M3|SWE-Bench Pro 59.0%のオープンウェイトモデルをMSAアーキ・1M文脈で読み解く
MiniMax M3は2026年6月1日公開のオープンウェイトモデル。SWE-Bench Pro 59.0%を主張し、新アーキMSAで1M文脈とネイティブマルチモーダルを両立する。ベンチの裏取り・computer use・ローカル実行・商用ライセンスの注意点まで一次ソースで整理する。
Microsoft MAI-Thinking-1とMAIファミリー7モデル——OpenAI依存を切る独自AI戦略
2026.06.03
Microsoft MAI-Thinking-1とMAIファミリー7モデル——OpenAI依存を切る独自AI戦略
Microsoft Build 2026で発表された自社開発7モデル「MAIファミリー」を解説。主力MAI-Thinking-1は35B active MoE・256Kで、盲検評価でSonnet 4.6超え・SWE-Bench ProでOpus 4.6並みと主張。OpenAI依存脱却戦略を一次ソースで整理する。
Codex CLIをOllamaでローカル実行2026|API課金もレート制限もないgpt-oss開発環境
2026.05.16
Codex CLIをOllamaでローカル実行2026|API課金もレート制限もないgpt-oss開発環境
Codex CLIをOllamaでローカル実行する2026年版ガイド。Ollama 0.24の『ollama launch codex』一発でgpt-oss等のOSSモデルにつなぎ、API課金もレート制限もなくOpenAI公式コーディングエージェントが動く。config.tomlプロファイルとCodex Appも解説。
PageIndex完全ガイド:Embeddingを捨てるRAGがFinanceBench 98.7%を取る
2026.05.09
PageIndex完全ガイド:Embeddingを捨てるRAGがFinanceBench 98.7%を取る
PageIndexはベクトルDBを使わず、長文PDFから階層ツリー・インデックスを構築しLLMがツリー推論で答えを引く新方式RAG。FinanceBench 98.7%精度、30k stars。CLI・Python API・MCPサーバまで導入と仕組みを徹底解説。
DFlash徹底解説|vLLM/SGLangで最大6倍高速化するブロック拡散ドラフトモデル
2026.05.07
DFlash徹底解説|vLLM/SGLangで最大6倍高速化するブロック拡散ドラフトモデル
Z LabがリリースしたDFlashはブロック拡散モデルでドラフトトークンを並列生成する投機的デコーディング新手法。Qwen3-8BでlosslessでEAGLE-3比2.5倍・最大6倍の高速化を達成。vLLM mainline/SGLang/Transformers/MLX対応で即実用可能。
Kimi K2.6とは|Moonshot AIの1兆パラメータ・オープンLLMを使い方まで解説
2026.04.21
Kimi K2.6とは|Moonshot AIの1兆パラメータ・オープンLLMを使い方まで解説
Kimi K2.6とは何かを公式情報で解説。Moonshot AIのオープンウェイト1兆パラメータMoEモデルで、SWE-Bench ProではGPT-5.4を上回る58.6%を記録。API・vLLMでのローカル使い方、300エージェント並列のAgent Swarm、料金・ライセンスまで整理する。
GLM-Skills:AIエージェント向け30以上のスキルを統合公開したOSS
2026.04.02
GLM-Skills:AIエージェント向け30以上のスキルを統合公開したOSS
Zhipu AI公式のGLMスキル集がオープンソース化。画像キャプション・PDF変換・株式分析・コード生成など30以上のスキルをClaude Code・OpenCode・OpenClawから即座に利用可能。導入手順と各スキルの活用例を今すぐ確認しよう。
ai-marketing-skills:マーケティング業務向けAIスキル習得リポジトリ
2026.04.02
ai-marketing-skills:マーケティング業務向けAIスキル習得リポジトリ
マーケティングプロフェッショナル向けのAI活用スキルセットを集約。431スター獲得の実践的リソース集で、AIツール導入と運用の知識を体系的に習得できる。概要 ai-marketing-skillsは、マーケティングおよび営業チーム向けのClaudeコード対応スキルセット。マーケティング実務で必要となるAI駆動型ワー…
SpatialLM:空間情報を言語モデルに統合する研究フレームワーク
2026.03.31
SpatialLM:空間情報を言語モデルに統合する研究フレームワーク
地理的座標や空間関係を大規模言語モデルに組み込むための研究基盤。空間推論能力を備えたAIシステムの構築を支援。GitHubで公開中、4424スター獲得。概要 SpatialLMは、大規模言語モデルに3D空間認識能力を統合するための研究フレームワーク。ポイントクラウド(点群データ)の処理と自然言語を組み合わせた空間理…
Microsoft Lida:自然言語からデータビジュアライゼーション自動生成するAIツール
2026.03.30
Microsoft Lida:自然言語からデータビジュアライゼーション自動生成するAIツール
テーブルデータを自然言語で指示するだけで、視覚化とグラフ生成を自動実行。データ分析の初期段階を効率化し、技術スキル不問でインサイト抽出を加速させる。GitHubで3236スター獲得の実績。
awesome-n8n - 実務的なn8nワークフローテンプレート集の活用ガイド
2026.03.28
awesome-n8n - 実務的なn8nワークフローテンプレート集の活用ガイド
awesome-n8nは2800スター超のn8n向け実務ワークフローテンプレート集。通信・ドキュメント生成・AI/LLMなど複数カテゴリに整理されており、ゼロから自動化フローを設計する手間を省いてすぐ始める方法を紹介
CAI(Cybersecurity AI)とは|9000スター超のAIペネトレーションテスト自動化フレームワーク
2026.03.28
CAI(Cybersecurity AI)とは|9000スター超のAIペネトレーションテスト自動化フレームワーク
CAI(Cybersecurity AI)はAlias Robotics開発、GitHub9,000スター超のAIセキュリティフレームワーク。LLMエージェントによるペネトレーションテスト自動化・CTF解法・プロンプトインジェクション防御を、ライセンス条件や企業導入事例(HackerOne等)まで含めて解説する。
Heretic:LLMのsafety alignmentを全自動除去するオープンソースツール完全解説
2026.03.27
Heretic:LLMのsafety alignmentを全自動除去するオープンソースツール完全解説
Hereticはトランスフォーマーベースの言語モデルからsafety alignmentを全自動で除去するツール。directional ablationとOptunaベースのパラメータ最適化で、高額な事後訓練なしに検閲解除モデルを生成できます。
AI reads books:PDFをページ単位でAI解析し知識ベースを自動構築するPythonスクリプト完全ガイド
2026.03.27
AI reads books:PDFをページ単位でAI解析し知識ベースを自動構築するPythonスクリプト完全ガイド
AI reads booksは、PDFをページ単位でAIに分析させ、知識ポイントの抽出と定期的なサマリー生成を自動化するPythonスクリプト。中断からの再開機能やTOC自動スキップにも対応しています。
OpenOats:会議音声をローカルで転記しLLMと対話できるツール
2026.03.26
OpenOats:会議音声をローカルで転記しLLMと対話できるツール
会議音声をMac上で完全ローカル転記し、Claude・GPT-4oなどのLLMで内容を検索・対話できるOSSツール。プライバシーを守りながら議事録作成を効率化しよう。概要 OpenOatsは、会議やミーティングの音声を自動で転記し、記録された内容をAIが対話的に検索・参照できるツール。従来型の手書きメモやテキスト議…
MoneyPrinterV2完全ガイド:YouTube Shorts・Twitter Bot・アフィリエイトを全自動化するPythonツール【3万スター】
2026.03.24
MoneyPrinterV2完全ガイド:YouTube Shorts・Twitter Bot・アフィリエイトを全自動化するPythonツール【3万スター】
MoneyPrinterV2はYouTube Shorts自動生成・Twitter Bot・アフィリエイトを全自動化するPython OSS。GitHub Stars 29,600超。gpt4free+KittenTTSで動画生成からSNS投稿まで一気通貫。仕組みと導入方法を解説。
RealtimeTTS:テキスト音声変換オープンソースで実現するLLM応答のゼロ遅延音声化手法
2026.03.24
RealtimeTTS:テキスト音声変換オープンソースで実現するLLM応答のゼロ遅延音声化手法
テキスト音声変換オープンソースの決定版。LLMの最初のトークンから音声を開始するPythonライブラリで、10種以上のエンジンを統一APIで切り替え可能。AIアシスタント開発者は今すぐ導入検討を。
Distributed Llama:家庭用デバイスを繋ぐだけでLLMローカル実行を高速化する分散フレームワーク
2026.03.24
Distributed Llama:家庭用デバイスを繋ぐだけでLLMローカル実行を高速化する分散フレームワーク
家にある複数のPCやRaspberry PiをLANで繋ぎ、テンソル並列処理でLLMローカル実行を高速化するC++製フレームワーク。Llama・Qwen3・DeepSeekに対応し、月3万円のAPIコストをゼロにした実績あり。今すぐ試せるインストール手順付きで解説します。
BitNet|Microsoftの1ビットLLM量子化フレームワーク — CPUだけで100Bモデルが動く仕組み
2026.03.24
BitNet|Microsoftの1ビットLLM量子化フレームワーク — CPUだけで100Bモデルが動く仕組み
Microsoftの1ビット量子化技術でLLMのメモリ使用量を90%削減し、エッジデバイスやスマートフォンでも高速なLLMローカル実行を実現する公式フレームワーク。CPUだけで100Bパラメータモデルが動く仕組みとインストール手順を徹底解説。
ClaraVerse:LLMローカル実行対応のプライバシー重視プライベートAIプラットフォーム完全ガイド
2026.03.23
ClaraVerse:LLMローカル実行対応のプライバシー重視プライベートAIプラットフォーム完全ガイド
ClaraVerseはChatGPT・Claudeをセルフホストし、データを外部送信せずLLMローカル実行できるオープンソースプラットフォームです。マルチモーダル対応、N8N互換ワークフロー、iOS/Androidアプリを統合。Docker導入手順やコード例を詳しく解説します。
よくある質問
LLM(大規模言語モデル)とは?
LLM(Large Language Model)は大量のテキストデータで訓練された言語モデル。文章生成・要約・翻訳・コード生成など幅広いタスクに対応する。GPT・Claude・Llama・Gemmaなどが代表的なモデル。
ローカルLLM実行に必要なスペックは?
7Bモデルなら8GB以上のVRAM(またはRAM)、13Bモデルなら16GB以上が目安。量子化(GGUF等)を使えば必要メモリを半分以下に削減可能。Apple SiliconのMacならUnified Memoryで効率的に動作する。
vLLMとOllamaの違いは?
vLLMは高スループットの推論サーバーで、本番API提供に最適。PagedAttentionによる効率的なメモリ管理が特徴。OllamaはローカルでのLLM実行を簡単にするツールで、ワンコマンドでモデルのダウンロード・実行が可能。開発・実験ならOllama、本番運用ならvLLMが向いている。
LLMのfine-tuning(ファインチューニング)はいつ必要?
プロンプトエンジニアリングやRAGで十分な精度が出ない場合にfine-tuningを検討する。特定ドメインの専門用語・文体・フォーマットへの適応が主な用途。LoRAやQLoRAを使えば少ないリソースでも実行可能。
RAGとLLMの違いは?
LLMは訓練データに基づいて回答するため、最新情報や社内データには対応できない。RAG(検索拡張生成)はLLMに外部データ検索を組み合わせる手法で、最新情報や独自データに基づく回答を生成できる。LLMが頭脳、RAGが参考資料という関係。
記事を検索
クラスタから探す
人気記事
タグで探す