コンピュータ画面を認識し、ボタンを押したり入力欄に文字を入れたりする形で直接業務を遂行するAIモデルが公開された。生成AI企業のGENONが「Hunmin(フンミン) VLM 397B」をオープンソースで公開した。このモデルは、アリババが公開した3,970億パラメータ規模のモデル「Qwen3.5-397B」をベースに、コンピュータ操作能力を加えたものだ。
画面上でボタンや入力欄のような操作対象がどこにあるかを見つけ出す段階から、オペレーティングシステムとプログラムを行き来しながら実際の作業を完了させる段階まで、能力を強化した。性能指標としては、画面内の操作対象の位置を見つける能力を評価する「ScreenSpot-Pro」で75.6点を記録し、Hugging Faceのリーダーボードで2位に上がったと同社は明らかにした。このリーダーボードに載った48個のモデルのうち、韓国内企業が作ったモデルはこのモデルのみだという。
Linux環境で360個の課題を遂行する「OSWorld」では70.5点を記録し、基本モデルより22.3点高かった。Windows環境の評価でも9.1点向上した。新しい能力を加えながら、韓国語性能が落ちないようにすることにも重点を置いた。GENONはKMMLUなど韓国語評価8種において、基本モデルとの差が2点以内だったと説明した。同じ基本モデルにコンピュータ操作能力を加えた比較モデルでは、一部項目で最大6点まで下がったというのが同社側の比較結果だ。
GENONが強調する部分は、学習に使った資源だ。既に公開されているコンピュータ操作モデルの能力を移した上で、モデル容量を減らした状態で教師あり学習と強化学習を行い、全過程でNVIDIA(エヌビディア)のB200 GPUを8枚使用した。4,000億パラメータに近いモデルを、この程度の規模の製造装置で高度化したという説明だ。GENONは昨年7月、7,430億パラメータモデルを小規模GPU環境で学習する方法を技術報告書として公開しており、今回その方法を実際のモデルに適用した。
GENONは昨年「Hunmin 32B」、今年初めに「Hunmin VLM 235B」を公開しており、これらを自社の実行型AI「ウォンエージェント」に接続してきた。今回のモデルも、企業業務においてAIが処理できる作業範囲を広げる用途に使う計画だ。
モデルはApache 2.0ライセンスで公開される。容量を半分程度に減らしたFP8バージョンとともに、比較モデルを同じ条件で再評価した方法も文書で公開した。ミョン・デウ GENON副社長(CTO)は「AIモデル競争の重心は、パラメータ規模を大きくすることから、必要な能力をいかに効率的に加えるかへと移っている」とし、「限られたコンピューティング資源でコンピュータ操作能力を強化しながら、韓国語性能まで維持した成果物だ」と述べた。
