AI企業NextGenAIが開発した韓国語埋め込みモデル2種が、テキスト埋め込み性能評価体系MTEBの韓国語ベンチマークにおいて、それぞれ異なる条件で1位を記録したと15日発表した。埋め込みモデルとは、文章や文書をコンピュータが比較できる数値ベクトルに変換するモデルで、社内文書検索や検索拡張生成(RAG、AIが回答前に関連文書を探して根拠として使う方式)、相談内容の担当部署振り分け、文書分類などに使われる。

同社によると、1億4,900万パラメータ規模の軽量モデル「ko-embed-v0」は、MTEB韓国語リーダーボードにおいて評価データを学習に使用していないモデルのみを比較する「ゼロショット専用」条件の総合順位で1位となった。SK telecomの「A.X-Encoder-base」を基盤に、公開された英語検索データで追加学習したモデルで、分類・クラスタリング・検索・文章類似度など韓国語20タスクを別途の学習なしにこなした結果だという。

併せて開発された約5億6,800万パラメータ規模の「ko-embed-cls」は、ニュース見出しをIT・科学、経済、社会など7分野に分類する単一のニュース分類タスク(KLUE-TC)で1位を記録した。BAAIの「bge-m3」を基盤に、KLUE-TC学習用のニュース見出し4万5,678件を学習した特化型モデルである。この2つの順位は15日公開時点のリーダーボードに基づくもので、リーダーボードは新規モデルの登録によって変動しうると同社は付け加えた。

NextGenAIは両モデルを、企業向け小型言語モデル(sLLM)とAIエージェント構築の異なる段階でそれぞれ活用する計画だ。企業にラベル付きデータが不足している初期段階ではゼロショットモデルで適用可能性を検証し、その後は実際の業務データを反映した特化型モデルで精度を高めるという方式である。同社は、検索や分類のように目的が明確な業務においては、大規模な汎用モデルよりも軽量な特化型モデルの方がGPUインフラの負担面で効率的だと説明した。

キム・ドギョンNextGenAI代表は「今回の結果は、モデルの規模拡大に注力するのではなく、企業現場で実際に活用できる軽量AIモデルを研究した成果だ」とし、「ゼロショットモデルで新規業務への適用可能性を確認し、企業が保有するデータで核心業務の精度を高める段階的なAI構築戦略を推進していく」と述べた。

昨年6月に設立されたNextGenAIは、20社余りの企業にAIコンサルティングとソリューションを提供してきており、KTのAIモデル「Mi:dm」を基盤に、根拠が確認された回答のみを出す法律AIを開発している。今後は10億パラメータ未満の汎用韓国語埋め込みモデルを高度化し、日本語評価へと対象を広げる計画だ。

原文:https://platum.kr/archives/294691