LumoraTechのエンジニアによる技術記事。AIエンジニアリング、フルスタックのアーキテクチャ、システム設計、そして本番システムを支える技術的な判断について掘り下げています。
RAGの解説記事はたいていおもちゃのような例で終わる。実運用で本当に必要になるもの——ハイブリッド検索、評価ゲート付きのCI/CD、荒れたドキュメントにも耐えるチャンク分割、そして本番で意味を持つ指標について書いた。
エージェントの監督グラフをどう設計するか、エージェント間の通信をどう扱うか、ヒューマンインザループの承認をどう組み込むか。そしてマルチエージェント構成につきまとうデッドロックをどう避けるか。
スケールに耐えるNext.js 15プロジェクトの構成——App Routerのパターン、データ層の切り離し、サーバーコンポーネントとクライアントコンポーネントの境界、そして破綻しない状態管理。
Chain-of-Thought、few-shotのキャリブレーション、PydanticAIによる構造化出力、そして本番システムのプロンプトを詰めるために使っている体系的な評価の枠組み。
レイテンシ、再現率、コスト、運用の手間という観点から3つのベクトルデータベースを実務的にベンチマークした。合成データではなく、実際の本番ワークロードで計測している。
リアルタイムのトレーディングダッシュボードを支えるアーキテクチャ——Redis Streams、コネクションプール、バックプレッシャーの制御、そして規模が出たときにだけ姿を見せる厄介なバグ。
データベースからフロントエンドまで一貫した型安全性——tRPC v11のセットアップ、Zodによるバリデーション、楽観的更新、そして実行時エラーの一群をまとめて消し去ったパターン。
コードの品質だけでなくAIの品質を検証するデプロイパイプラインの作り方。pytestのフィクスチャとして書く評価スイート、精度のゲート、コスト監視、そしてモデルの劣化に備えたロールバック戦略。
ファインチューニングとプロンプト改善とRAGを、どう使い分けるかの判断基準。データセットの準備、LoRAの設定、評価の進め方、モデルサイズごとのコスト分析までまとめた。
この一年で導入して、効果が数字で見えたツールを選んで紹介する。ローカルLLMのコーディング支援から、ターミナル環境、データベースツール、オブザーバビリティ基盤まで。
「自分の環境では動く」から「1万ユーザーを支えられる」までの、地味な作業について。エラーバジェット、オブザーバビリティ、負荷試験、フィーチャーフラグ、そして作る側から運用する側への意識の切り替え。
私たちが使っているローカルAI開発環境の全体像——Ollamaでのモデル管理、GPUメモリの最適化、VS Codeとの統合、そして手元のマシンでモデル性能を比べるためのベンチマークスクリプト。