4Bしか動かないのに、15倍サイズを上回る — 学習データまで丸ごと公開されたK2 Horizon
アブダビのMBZUAI系IFMが公開したフルオープンモデル群K2 Horizon。36Bのうち4Bだけ動くMoVA構成、Apache 2.0、学習データとコードまで全公開という中身を、ローカルLLM視点で解説する。
9件の記事
アブダビのMBZUAI系IFMが公開したフルオープンモデル群K2 Horizon。36Bのうち4Bだけ動くMoVA構成、Apache 2.0、学習データとコードまで全公開という中身を、ローカルLLM視点で解説する。
AlibabaがQwen3.8-Flash-Nextを公開。総125BのマルチモーダルMoEでアクティブは6B、次世代Qwen4アーキを先取りするオープンウェイトの低コスト版。設計思想と日本で動かす意味を整理する。
Ant Groupが公開したエージェント特化の高効率MoEモデルLing-3.0-Flash。124Bで5.1Bだけ動く仕組み、自社1T旗艦に匹敵する性能、無料提供期間を解説する。
JetBrainsのMellum2は12BのオープンなMoEコーディングモデル。トークンあたり2.5Bだけ動かして2倍速い推論を狙う。何が速いか、どこに使うか、ライセンスと注意点を解説する。
ZAYA1-8Bは総パラメータ8.4Bながら活性760MのMoE推論モデル。AIME 91.9%の実力、AMD学習の背景、ローカル実行の可能性を解説。
Mistral Small 4は119B MoEで推論・画像・コードを統合。Apache 2.0で無料。使い所を解説。
DeepSeek V4はPro/Flashの2構成。GPT-5.5比97%安でコーディング互角。料金と使い分けを解説。
Qwen3.6-35B-A3Bは35Bパラメータのうち3Bだけ使う超効率MoEモデル。SWE-bench 73.4%の実力をOllamaでローカル実行する方法、27B Dense版との違いを解説。
Tencentが295B MoEモデル「Hy3 Preview」をオープンソース公開。SWE-bench 74.4%の実力、入力0.18ドルの価格、既存サービスへの統合状況を解説する。