AIエージェント研究開発:GeminiとDeepSeekを実測比較、安さだけで本番切替しなかった理由
金融AI/AIエージェント研究開発
AIエージェント研究開発:GeminiとDeepSeekを実測比較、安さだけで本番切替しなかった理由
AIエージェントのモデル選定で見るべきものは、単価だけではありません。応答品質、ツール発火、課金処理、安全停止、そして本番へ戻せる証跡まで含め、GeminiとDeepSeekを同じ条件で再実測しました。
※本投稿は、私が開発したインジケーターと自動売買ソフト(EA)を含む複数のAIエージェントを、実運用に近い環境で研究・検証している開発ログです。成功・失敗の両方を評価データとして蓄積し、金融AIのロジック改善にも同じ検証手順を適用しています。GOLD13の実口座検証は、平日24時間のトレードライブ配信でも公開しています。
同じ60パターンで両系を比較
比較はGeminiとDeepSeekの各60パターンで実施しました。終了理由はGeminiがstop 45・tool_calls 15、DeepSeekがstop 43・tool_calls 17で、length終了とAPIエラーは両方とも0件でした。
単純な会話だけでなく、記録ツールが必要な経路、ツールを呼ぶべきでない経路、未成年・ケガ相談の安全な引き継ぎ、多言語応答まで含めています。金融AIでも、判断文の自然さだけでなく、注文・記録・課金・停止条件を別々に検証する必要があるためです。
1往復原価の実測
- Gemini 2026促進価格:平均約0.689円/往復。
- Gemini 2027正式価格換算:平均約1.378円/往復。
- DeepSeekピーク帯:平均約0.501円/往復。
- DeepSeekオフピーク帯:平均約0.251円/往復。
DeepSeekでは入力318,893トークンのうち307,065トークンがキャッシュヒットし、実測ヒット率は96.3%でした。上のDeepSeek原価は入力をすべてミス単価で計算した保守的な値なので、実請求は下がる方向です。
安いが、品質差は残った
コスト面ではDeepSeekが有利でしたが、全経路で同等と判断できる状態ではありません。マネージャー系の技術質問では要目視ケースが2件、技術質問から担当コーチへの引き継ぎは5言語中4件で、zh-TWは未検出でした。
記録ツールも、打席記録3/5、投球記録4/5、試合結果5/5、成績訂正5/5でした。未発火の一部は、モデルが試合を一意に特定できず確認質問を返したケースです。これは誤記録を防ぐ安全動作とも読めますが、「必ず一回で記録する」という観点では未達です。
隔離環境の実DB検証は21項目PASS
本番ポート4002を触らず、検証専用インスタンスを4102で起動して実HTTP・実DBの9ターンを確認しました。記録、訂正、課金、残高不足時の非書込み、同一対象への重複課金防止、Markdown記号0件など、21項目はすべてPASSしました。終了後は検証プロセスだけを停止し、本番4002が200を返すことも確認しています。
本番切替は未実施
ここまでの結果があっても、DeepSeekへの本番先行切替は行っていません。本番のプロバイダー上書き設定は空のままで、承認後に限定系統だけを切り替え、24時間監視する手順を残しています。安価であること、テストに通ること、本番へ入れてよいことを分けて判断しました。
動画照合:本稿はモデル比較と実DB検証の開発記録で、GOLD13の特定トレードに対応する記事ではありません。無関係なトレード録画は埋め込みません。
本稿は研究・検証ログであり、利益や将来の性能を保証するものではありません。
比較条件をそろえないと単価差は意味を持たない
モデル比較では、プロンプトの長さ、会話履歴、利用ツール、言語、キャッシュ条件が違うだけで原価と成功率が変わります。今回は同じ60パターンを通し、stop、tool_calls、length、API errorを同じ方法で記録しました。
単純会話だけを多く入れると、ツールが必要な本番業務の差を見落とします。そのため、記録すべきケース、記録してはいけないケース、確認質問が必要な曖昧入力、未成年やケガ相談、多言語、課金を含めました。
ツール未発火をどう評価したか
打席3/5、投球4/5という数字だけなら失敗に見えます。しかし一部は試合を一意に特定できず、モデルが確認質問を返したケースでした。誤った試合へ記録するより安全ですが、「一往復で完了」という業務要件では未達です。
そこで、ツールが発火したかだけでなく、発火しなかった理由、確認質問の妥当性、次の応答で完了できるかを分けて評価します。金融AIでも、注文しなかった事実と、適切に見送った理由は別々に保存する必要があります。
キャッシュ96.3%が示すこと
DeepSeekの入力318,893トークン中307,065トークンがキャッシュヒットしました。定型指示や共通コンテキストが多い業務では大きなコスト差になります。一方、相場状況のように毎回変わる入力では、同じヒット率が続く保証はありません。
そのため、今回の原価を全業務へそのまま当てはめず、用途別に入力構成とヒット率を測ります。促進価格、正式価格、ピーク帯、オフピーク帯も分け、将来価格で逆転しないかを確認します。
品質の観測点
- 必要なツールを正しい引数で一度だけ呼ぶか
- 不要な場面でDBを書き換えないか
- 曖昧な対象を勝手に補完しないか
- 安全上の相談を適切な担当へ渡せるか
- 多言語でも同じ停止条件を守るか
- 課金と保存が同一処理として整合するか
文章の自然さだけではなく、外部作用の正確さを中心に採点します。誤答より誤記録の方が復旧コストが高い業務では、この順序が重要です。
本番切替を見送った判断
DeepSeekは安価で、実DB検証21項目もPASSしました。しかし、技術質問の要目視2件、zh-TW引き継ぎ未検出、記録ツールの未達が残っています。全系統を一括変更すると原因の切り分けが難しくなるため、限定系統から24時間監視する計画にしました。
安いモデルを選ぶことが目的ではなく、同じ安全性をより低い原価で実現できるかが目的です。切替前後の品質と復旧性を測れないなら、単価差だけで本番を動かしません。
金融AIへ応用する原則
相場判断モデルを変更するときも、バックテストの利益だけでは決めません。シグナル発火、見送り、注文引数、停止条件、ログ欠損、通信失敗を同じ条件で比較します。モデル変更による差とEAロジック変更による差を混ぜないため、変更は一つずつ行います。
次回比較で追加する負荷試験
60パターンの機能比較に加え、同時実行数を増やしたときの応答時間、429・5xx発生率、再試行後の二重作用、長い会話履歴でのキャッシュ変化を測定します。価格が安くてもピーク時間に処理が滞留すれば、ユーザー待ち時間と再試行コストが増えます。
さらに日本語だけでなく、今回差が出たzh-TWを含む多言語の引き継ぎを再試験します。ツール発火率は総数だけでなく、正しい対象、正しい引数、重複なしという3条件で採点します。次回は平均値に加え、遅い側の95パーセンタイルも残します。