AI企業Sionic AIは、13日、自社の検索埋め込みモデル「comsat-embed」が韓国語と日本語のグローバル検索ベンチマークで1位を記録したと発表した。埋め込みモデルは文章の意味を数値に変換し、質問に関連する文書を探し出す技術で、企業向けAIの検索拡張生成(RAG)の品質を左右する基盤要素だ。
同社によると、韓国語モデル「comsat-embed-ko-8b-preview」は、グローバル埋め込み評価指標MTEBの韓国語検索9データセット評価で平均NDCG@10 79.30を記録し、比較対象モデルの中で最も高い数値を示した。これはAlibaba(アリババ)の「Qwen3-Embedding-8B」(78.25点)、Microsoft(マイクロソフト)の27Bモデル「Harrier-OSS-v1-27B」(76.69点)を上回る数値だ。NDCG@10とは、検索結果上位10件が実際の正解とどれほど関連性が高く、適切な順序で配置されているかを測る指標である。
日本語でも「comsat-embed-ja-8b-preview」が11データセット評価で平均81.33を記録し、比較モデルの中で最高性能を示した。また、3億パラメータの軽量モデルも4B以下の比較モデルの中で1位だった。
同社が強調するのはスコアよりも学習方式だ。実際の検索では、質問が短いキーワードの場合もあれば、複数の段落を総合しなければならない文章の場合もあり、正解が文書の中間や末尾にある場合もある。Sionic AIはこうした実使用環境を反映し、様々な出典の文書に複数の形態の質問を合成し、質問と文書の関係を1対多・多対1の構造で学習させた。正解と類似しているが正解ではない文書を選んで学習させるハードネガティブマイニング、性能の高い教師モデルの検索順位を学ぶ知識蒸留も適用した。特定のデータセットのスコアを引き上げて平均を作ったのではなく、評価セット全般で均等に改善されたという点を根拠として挙げている。
今回のモデルは、言語・ドメイン・質問形態が変わっても安定的に検索できる汎用埋め込みを目指す「EUREKA」プロジェクトの初の公開成果物だ。韓国語・日本語モデルはHugging Face(ハギングフェイス)にプレビュー版として公開されている。

