公開されている人工知能ランキングで堂々と1位を占める大規模言語モデル(LLM)は、実際のTossの現場サービスでも同じように優れた性能を発揮するとは限りません。新しいモデルがリリースされるたびに、私たちはまず数学をどれだけ正確に解き、コードをどれだけ滑らかに書けるかを測ったスコアボードを確認する傾向にあります。スコアが高いと、自社のサービスにすぐに導入して劇的な効率化を実現できるという楽観的な期待を抱きがちです。しかし、実際の運用環境にそのモデルを適用してみると、期待と異なる結果が出るケースが非常に多いです。英語を流暢に扱うモデルだからといって、国内の金融規制や複雑な政策文書を完璧に理解できるとは限りません。推論分野で高得点を収めたモデルが、リアルタイム応答が生命線となる現場の運用環境でも機敏さを保つとは断定できません。何より、公開試験で高得点を取る能力と、実際の金融・コマース領域の難しい業務を処理する能力は、全く異なるものです。TossのAIモデリング部門では、こうしたギャップを縮め、実際の現場に最適化されたモデルを選ぶために、独自の評価基準を策定しました。この記事では、Tossが限られたリソースを効率的に活用するためにどのような基準を設け、評価指標をどのように磨いてきたのかを詳しく見ていきます。
=
リーダーボード1位のLLM、Tossでも1位なのか?Toss構築記

1. TossがAIで解決する実際の現場の問題

Tossは単なる金融アプリにとどまらず、コマース、広告、社内開発およびインフラ運用まで領域を拡大し、大規模言語モデルを多方面で活用しています。まずコマース分野では、無数の販売者がバラバラに登録した商品情報を自動的に標準化し、一致する商品をグループ化する役割を担っています。Toss Shoppingに出店した販売者と直接通話し、商品運営に必要な事項を調整する音声エージェントシステムも、AIを基盤としてスムーズに動作しています。販売者が返す回答の文脈をリアルタイムで把握し、会話の流れを柔軟に変化させ、必要なツールを正確に呼び出す能力が不可欠です。加盟店審査や決済部門では、膨大な書類から事業者情報を正確に抽出し、原本資料と照合する作業を行います。決済に関する問い合わせが寄せられた場合、複雑な社内データや計算ルールを自ら照会し、顧客に滞りなく回答を提供します。広告審査の領域では、広告文や画像を綿密に確認し、ユーザーがクリックした際に接続されるウェブページが安全かどうかを検査します。広告の成果に急激な異常が検出された場合、過去の設定変更履歴や成果データを隅々まで照会し、原因を特定して対応策を策定します。このように、Tossの様々な部門で大規模言語モデルは、もはや欠かせない中核的な存在として黙々とその役割を果たしています。
Tossはコマースと金融を網羅する多様な業務で大規模言語モデルを活用し、複雑な問題を解決しています。
2. 公開ランキングと現場環境の乖離

新しいAIモデルを導入する際、インターネットで公開されているランキングは候補を絞り込むための非常に有用な指針となります。しかし、評価に使われた言語や推論の設定方法が、実際の国内ユーザーが直面するサービス環境と異なれば、ランキングが完全に逆転することもあります。英語ベースの測定で莫大なスコアを記録したモデルでも、韓国語のクエリに対しては的外れな回答を返す可能性があります。実際に、数学とコーディング能力を検証する際、同じ問題の英語原文と自然な韓国語訳をそれぞれ入力して比較する実験を行いました。その結果、驚くべきことに、英語基準の評価で優位に立っていたモデルが、韓国語訳の評価では順位が下がる現象が観察されました。数学問題において英語スコアが高かったモデルよりも、韓国語問題でむしろより高いスコアを記録したモデルが登場しました。コーディングテストの場面でも、英語環境では先行していたモデルが、韓国語の指示事項を処理する過程で他のモデルに首位を譲る結果となりました。これらの結果は、単にスコアの高低を超えて、モデル間の相対的な優位関係自体が言語によって変わることを示唆しています。したがって、国内顧客を対象にサービスを提供する企業であれば、翻訳されたクエリでも一貫した性能を発揮しているかを必ず検証する必要があります。
公開ランキングの英語スコアが高くても、韓国語クエリ環境ではモデル間の順位が逆転する可能性があります。
3. 韓国語知識と文化的文脈の重要性

数学やプログラミングの領域以外にも、国内ユーザーの日常的な知識や固有の文化的文脈を正確に理解する能力が非常に重要です。海外で開発された大規模言語モデルは膨大な英文資料を学習しているため、西洋圏の常識には明るくても、国内の感情や文脈には疎い可能性があります。韓国固有の金融制度や税法、そして日常的な生活言語の微妙なニュアンスを把握できなければ、的外れな相談を提供することになります。例えば、全宅(チャンセ)保証金や住宅抽選制度に関する質問を受けた際、国内法令を適切に反映できないと大きな混乱を招きます。金融商品の約款を分析する際も、単に文字を読み取るだけでなく、行間に隠れた消費者保護規定を正確に指摘する必要があります。そのため、評価基準を策定する際、国内の知識レベルや文化的背景をどれだけ深く理解しているかを測定する項目が必ず含まれるべきです。計算速度が速く論理力が優れていても、国内顧客の感情を読み取れないモデルは、現場に投入される資格はありません。Tossはこうした現実的な限界を克服するため、韓国語特化の評価問題を大量に発掘し、自社評価表に反映しました。
国内固有の文化的文脈と金融制度を正確に理解する韓国語特化知識の検証が不可欠です。
4. Tossドメイン向けカスタマイズ評価基準の設計

汎用的な能力が検証されたら、次は実際のTossの業務環境にどれだけ適切に適合しているかを精密に測定する必要があります。Tossの評価体系は、主に金融、コマース、顧客相談、社内開発の領域に分かれ、実際の業務データを活用しています。住宅ローン相談のプロセスをシミュレーションする際は、知識検索システムや相場照会機能、そして総負債元利返済比率(DSR)計算ツールを熟練して呼び出しているかを確認します。顧客相談自動化の段階では、複雑な顧客情報を安全に照会し、問い合わせに正確に回答し、機微な事案はオペレーターに転送します。開発運用の領域では、コードの変更点を綿密にレビューし、構造化されたクエリ分析を通じてデータ品質検査ルールを生成します。障害が発生した際、サーバーのログ記録や主要指標、ソースコードを総合的に調査し、原因候補を導き出します。こうした複雑な実際の業務シナリオに基づいてモデルの実行能力をスコア化し、現場にすぐに投入できるかどうかを判定します。単に試験問題をうまく解くだけでなく、実際のツールと有機的に連携する能力に優れたモデルだけが、最終的なサービング対象に選ばれます。
実際のTossの業務データとツール連携シナリオを反映した、ドメイン向けカスタマイズ評価基準を設計しました。
5. 限られたリソースの中での最適モデル選別

すべてのAIモデルを現場に無条件に導入できない最大の理由は、莫大なGPUリソースとコストの限界にあります。性能が優れているという理由だけで、あまりにも重いモデルを採用すると、応答速度が遅くなり、運用コストが耐え難いほど膨らみます。そのため、Tossは性能スコアだけでなく、サービングに消費されるリソースの効率性も同時に考慮し、最適なバランス点を見つけ出します。評価結果に基づき、軽量でありながら特定の業務で優れた効率を発揮するモデルを選び出し、コストパフォーマンスを最大化します。音声エージェントのようにリアルタイム性が重要なサービスでは、レイテンシが短いモデルを優先的に配置・展開します。一方、深い分析や約款レビューのように、速度よりも精度が極めて求められる領域には、少し重い高性能モデルを割り当てます。こうした細やかなリソース配分戦略のおかげで、Tossは品質低下なしに安定かつ持続可能なAIサービスを運営できます。限られたリソースを最も賢く配分する過程自体が、大規模言語モデル導入の成否を分ける鍵となります。
GPUリソースと運用コストの限界を考慮し、最適な効率を発揮するモデルを選別します。
6. Toss AIの未来と発展方向

今後、Tossは自社評価体系をさらに高度化し、急激に変化するAIエコシステムに素早く対応していく計画です。毎日 쏟아出される新しいモデルを手作業で一つずつ検証する代わりに、自動化されたパイプラインを通じて迅速に優位性を判定します。また、Tossファウンデーションモデルが備えるべき固有の能力を定義し、それを強化するための学習データやプロンプトを継続的に補強します。単に外部モデルを取り入れることに留まらず、Toss独自の金融ドメイン知識を織り込んだ特化型モデルを完成させていきます。現場部門との緊密なコミュニケーションを通じて、実際にAIが最も必要とされる領域を発掘し、性能を継続的に改善します。こうした努力は、最終的に顧客がTossアプリを利用する際に、より安全で便利かつインテリジェントな金融体験を楽しめるようにする礎となります。完璧なモデルとは、最初から存在するものではなく、現場の声を反映させながら絶えず磨き上げる過程の中で初めて生まれるものです。
継続的な評価体系の高度化と現場との連携を通じて、よりインテリジェントで安全な金融体験を創り出しています。
よくある質問
=