Category · products

プロダクト & モデル

85

主要LLM・API・ベンチマーク・研究の最新動向。新機能の発表からモデル性能の比較まで、AIプロダクトの動きを追う。

Featured Image
プロダクト & モデル報道

Mixture of Experts、自然言語処理を越え文化財デジタル化へ——青銅器銘文認識で「36エキスパート構成」が最高精度を記録

Nature誌に掲載された研究で、MoEアダプターを用いた青銅器銘文認識モデルがエキスパート数36構成で最高精度を達成。LoRA等PEFT手法を補完する形でMoEの応用範囲がテキスト生成外に拡大している。

2026.08.27
Close-up of a 3D printer head in operation
プロダクト & モデル報道

国産LLM「LLM-jp-4」が日本語MT-BenchでGPT-4o超え——Gemma 4・MiniMax M2.1も続き、オープンソースLLM公開ラッシュ

国立情報学研究所の「LLM-jp-4」が日本語MT-Benchで7.82点を記録しGPT-4o(7.29点)を上回った。Gemma 4のApache 2.0公開、MiniMax M2.1のリリースも続き、オープンLLMの実力がクローズドモデルに迫っている。

2026.08.26
Featured Image
プロダクト & モデル報道

GPT-5.1〜5.6・Gemini 3系・Claude Opus 4.8——3社が新機能で描く「用途別住み分け」地図

2025年11月以降、OpenAI・Google・Anthropicが立て続けに新機能を投入。GPT-5.1のトーン調整とその後のGPT-5.5・5.6、Gemini 3.1 Proの100万トークン処理と廉価版3.5 Flash、Claude Opus 4.8のコーディング・エージェント特化など、性能一位争いから用途別住み分けへと競争軸が移っている。

2026.08.25
Featured Image
プロダクト & モデル報道

LLM API価格、値上げと値下げが同時進行——DeepSeek急騰・中国クラウド460%高騰の裏でOpenAIは80%値下げ

DeepSeekが1カ月足らずで再値上げを予告する一方、OpenAIはGPT-5.6 Lunaを80%値下げ。テンセントは特定モデルで463%高騰と、LLM API価格は二極化している。

2026.08.24
Featured Image
プロダクト & モデル報道

AIエージェント、単発タスクから業務プロセス全自律化へ——Oracle・Manus・Geminiが示す実装の深化

OracleがAI Agent Studioで部門横断業務を自動化し22エージェント型アプリに4種を追加、Manus 1.6は自律実行の成功率向上とユーザー満足度約20%上昇を実現、GoogleはGemini 3.7 Flashを前バージョンから3週間で公開し初回利用価格を半額化。実装の深さで競争が進む。

2026.08.23
Featured Image
プロダクト & モデル報道

Claude Mythos、脅威能力ゆえの異例経路——Preview発表から輸出規制停止まで3カ月半の軌跡

AnthropicのClaude Mythos Previewは2026年4月7日発表後、Firefoxエクスプロイト成功率72.4%など脆弱性発見・攻撃能力の高さから一般公開が見送られ、Project Glasswing経由での限定提供にとどまった。6月には安全対策の強度を分けたFable5(一般向け)とMythos5(パートナー向け)が発表されたが、7月22日に米政府の輸出規制指令により両モデルとも全面停止となった。

2026.08.22
Featured Image
プロダクト & モデル報道

RAG手法、生成AIサイバー攻撃の高度化に対抗——中小企業向け防御への応用が拡大

2026年、RAG手法が中小企業のセキュリティ防御に応用される一方、北朝鮮系Kimsukyは生成AIを攻撃チェーンに組み込むなど、攻防双方でAI活用が加速している。

2026.08.21
MLPerf Training v6.0公開——DeepSeek-V3 671Bが新指標に、CoreWeaveは8192GPUで2.02分・NVIDIAとAMDが記録競う
プロダクト & モデル確認済

MLPerf Training v6.0公開——DeepSeek-V3 671Bが新指標に、CoreWeaveは8192GPUで2.02分・NVIDIAとAMDが記録競う

MLCommonsが2026年6月16日公開したMLPerf Training v6.0で、DeepSeek-V3 671Bの学習性能が新指標に。CoreWeaveは8192GPUで2.02分、NVIDIAやAMDも記録を競った。

2026.08.20
GPT-5がSWE-bench Verifiedで74.9%達成——ベンチマーク急伸が示す「飽和」の兆し
プロダクト & モデル確認済

GPT-5がSWE-bench Verifiedで74.9%達成——ベンチマーク急伸が示す「飽和」の兆し

OpenAIのGPT-5がSWE-bench Verifiedで74.9%を記録しo3の69.1%を上回った。Stanford AI Indexによれば同指標は2023年の4.4%から2024年に71.7%へ急伸しており、ベンチマーク飽和が進む。

2026.08.19
MoE研究、ルーティング効率化から「メモリの壁」対策へ——Apple SpecMDとUniMoMoが示す次の焦点
プロダクト & モデル分析

MoE研究、ルーティング効率化から「メモリの壁」対策へ——Apple SpecMDとUniMoMoが示す次の焦点

MoE研究はGoogleのExpert Choice Routingで2倍の学習効率、Microsoft MH-MoEで専門家活性化率90.71%を達成した後、Apple SpecMDやPhison、UniMoMoなど「メモリ効率・専門家マージ」対策へ焦点が移りつつある。

2026.08.18
国産オープンソースLLM「LLM-jp-4」と「Rakuten AI 3.0」が公開——中国勢の猛攻に日本は「AI主権」で対抗
プロダクト & モデル報道

国産オープンソースLLM「LLM-jp-4」と「Rakuten AI 3.0」が公開——中国勢の猛攻に日本は「AI主権」で対抗

NIIが日本語MT-Benchでスコア7.82の「LLM-jp-4」を公開、楽天も7000億パラメータの「Rakuten AI 3.0」を無償提供。同時期に中国・小米はパラメータ1兆超の「MiMo-V2.5」を発表し攻防が激化。

2026.08.17
Claude・GPT・Gemini、機能競争が新局面へ——メモリ無料開放・法人7モデル統合・マルチAI議論機能が相次ぐ
プロダクト & モデル報道

Claude・GPT・Gemini、機能競争が新局面へ——メモリ無料開放・法人7モデル統合・マルチAI議論機能が相次ぐ

Claudeがメモリ機能を無料開放し他社データも移行可能に。GPT-5.2/Claude4.5/Gemini3が法人基盤へ一括搭載。3AI議論機能も登場し競争軸が変化。

2026.08.16
DeepSeek値上げ予告とMiniMax「実質値上げ」——中国LLM API、値下げ競争から転換点へ
プロダクト & モデル報道

DeepSeek値上げ予告とMiniMax「実質値上げ」——中国LLM API、値下げ競争から転換点へ

DeepSeekが1カ月足らずで2度目のAPI値上げを予告、MiniMax M3も実質値上げで株価15%安。中国LLMの超低価格戦略に転換点。米中の価格差は依然34倍規模で残る。

2026.08.15
AIエージェント、単体性能から『連携』へ——Hermes Agent 0.20.0がA2A実装、Copilot StudioもA2A一般提供
プロダクト & モデル報道

AIエージェント、単体性能から『連携』へ——Hermes Agent 0.20.0がA2A実装、Copilot StudioもA2A一般提供

Nous ResearchのHermes Agent 0.20.0がA2A v1.0を実装、Microsoft Copilot StudioもA2A通信を一般提供。AIエージェントの競争軸が単体性能から連携基盤へ移行している。

2026.08.14
Claude Mythos Preview、脆弱性エクスプロイト成功率72.4%で非公開に——3か月後にFable 5とOpus 5が一般提供
プロダクト & モデル報道

Claude Mythos Preview、脆弱性エクスプロイト成功率72.4%で非公開に——3か月後にFable 5とOpus 5が一般提供

AnthropicのClaude Mythos Previewは修正済みFirefox脆弱性へのエクスプロイト作成試行で成功率72.4%を記録し、一般公開を見送られた。6月に保護機能付きのClaude Fable 5が一般提供され、上位版Mythos 5は限定パートナー向けに提供。7月には低価格のClaude Opus 5が登場し、コーディング等の一般性能でFable 5を上回る一方、攻撃的サイバー能力は意図的に制限された。

2026.08.13
RAG進化の最前線——清華大学Hyper-RAGが幻覚48%減、VLDB2026採択のQA-GraphRAGはクエリ適応検索を実現
プロダクト & モデル報道

RAG進化の最前線——清華大学Hyper-RAGが幻覚48%減、VLDB2026採択のQA-GraphRAGはクエリ適応検索を実現

清華大学らのHyper-RAGは超図構造により知識欠落60%減・幻覚48%減を実証。VLDB2026採択のQA-GraphRAGはクエリの粒度に応じて検索階層を自動選択する手法で、5つの主要GraphRAGフレームワークの性能を向上させた。さらに知識ポイズニング攻撃への防御研究も進み、企業では「RAGからContext Engineeringへ」という語義層論争も進行中。

2026.08.12
MLPerf Training v6.0発表、NVIDIA GB300が2.02分でDeepSeek-V3学習——AMDはInference 6.0で100万トークン/秒突破
プロダクト & モデル確認済

MLPerf Training v6.0発表、NVIDIA GB300が2.02分でDeepSeek-V3学習——AMDはInference 6.0で100万トークン/秒突破

MLCommonsが2026年6月16日発表のMLPerf Training v6.0で、CoreWeaveがGB300 8192基でDeepSeek-V3 671Bを2.02分で学習。AMDは別途4月公開のMLPerf Inference 6.0でMI355Xが100万トークン/秒を突破し、6月のTraining 6.0でもMI350シリーズが対応範囲を拡大した。

2026.08.11
SWE-bench Verifiedスコア、GPT-4oの33.2%からGPT-5の74.9%へ急伸——専門家は「ベンチマーク飽和」に警鐘
プロダクト & モデル報道

SWE-bench Verifiedスコア、GPT-4oの33.2%からGPT-5の74.9%へ急伸——専門家は「ベンチマーク飽和」に警鐘

SWE-bench Verifiedスコアが2023年の4.4%から2024年に71.7%、GPT-5では74.9%まで急伸。SWE-bench ProではGPT-5.6 Sol Ultraが63.4%、比較対象のClaude Mythos Previewが80%を記録。韓国K-EXAONE 2.0も49.4%→68.2%に躍進する一方、専門家はベンチマーク飽和と実行動評価の欠落を指摘する。

2026.08.10
teal curved wallpaper
プロダクト & モデル報道

MoEの“メモリの壁”に挑む研究相次ぐ——AllenAI/UC BerkeleyのEMOは専門家12.5%で性能維持、AppleはSpecMDでキャッシュ最適化

Mixture of Experts(MoE)モデルの計算は疎でもメモリは全専門家分必要という矛盾に対し、AllenAI/UC BerkeleyのEMOやAppleのSpecMDが解決策を提示。LGのK-EXAONE 2.0(750億パラメータ、256専門家中8つのみ活性化、実質370億相当)など実装も加速。

2026.08.09
NII、国産LLM「LLM-jp-4」を公開——日本語性能でGPT-4o超え、世界は2兆8000億パラメータの中国製が最大規模に
プロダクト & モデル確認済

NII、国産LLM「LLM-jp-4」を公開——日本語性能でGPT-4o超え、世界は2兆8000億パラメータの中国製が最大規模に

NIIが「LLM-jp-4」8B・32B-A3Bを公開、日本語MT-Benchで7.82とGPT-4o(7.29)超え。世界ではMoonshotの「Kimi K3」が2.8兆パラメータで最大規模のオープンソースモデルとなった。

2026.08.08
GPT-5.6・Claude Opus 4.8・Gemini 3.1 Pro、コンテキスト100万トークンで“スペック収束”——差は料金と実運用に移行
プロダクト & モデル報道

GPT-5.6・Claude Opus 4.8・Gemini 3.1 Pro、コンテキスト100万トークンで“スペック収束”——差は料金と実運用に移行

GPT-5.6・Claude Opus 4.8・Gemini 3.1 Proが100万トークンで並び、性能差より料金体系と用途別の使い分けが企業の選定基準になっている。

2026.08.07
LLM API価格改定ラッシュ2026——テンセント463%高騰の裏でGoogle・AWSも一斉値上げ、企業はキャッシュ技術で防衛
プロダクト & モデル報道

LLM API価格改定ラッシュ2026——テンセント463%高騰の裏でGoogle・AWSも一斉値上げ、企業はキャッシュ技術で防衛

2026年1〜3月、AWS・Google Cloud・中国クラウド大手が相次ぎLLM関連API価格を改定。テンセントは最大463.13%値上げ。企業はプロンプトキャッシュ等で対抗を迫られている。

2026.08.06
AIエージェント、単純作業から経営判断へ——Oracle・Harnessが示す2026年夏の実装最前線
プロダクト & モデル報道

AIエージェント、単純作業から経営判断へ——Oracle・Harnessが示す2026年夏の実装最前線

OracleがAI Agent Studioで経営意思決定支援を強化、22の業務エージェントに4種追加。同時にHarnessとGoogle Cloudが企業向けAIエージェントのセキュリティ連携を発表し、実装と防御の両面で進化が加速している。

2026.08.05
Claude Mythos発表から3カ月半でMicrosoftに首位陥落——AI性能競争の激しさ露呈
プロダクト & モデル報道

Claude Mythos発表から3カ月半でMicrosoftに首位陥落——AI性能競争の激しさ露呈

2026年4月発表のClaude Mythos Previewはサイバーセキュリティ上のリスクから非公開に。6月にFable 5・Mythos 5として一般公開され、7月にはOpus 5が後継として登場したが、同月27日にMicrosoftのMAI-Cyber-1-FlashがCyberGymベンチマークでMythos 5を12ポイント上回り首位を奪取した。

2026.08.04
a black and white photo of a rope with a sign on it
プロダクト & モデル報道

RAG手法2026年最新動向:GraphRAG・エージェント型RAGが主流化、一方で「知識ポイズニング攻撃」が新たな脅威に

2026年のRAGはGraphRAGやエージェント型に進化する一方、KidnapRAGなど知識ポイズニング攻撃が台頭。企業導入には精度とセキュリティ両面の設計が不可欠になっている。

2026.08.03
MLPerf 2026最新結果、NVIDIA Blackwellが288GPUで250万トークン/秒の推論記録樹立
プロダクト & モデル確認済

MLPerf 2026最新結果、NVIDIA Blackwellが288GPUで250万トークン/秒の推論記録樹立

MLCommonsが2026年4月と6月にMLPerf v6.0結果を公表。NVIDIAはBlackwell Ultraで250万トークン/秒を記録、AMDは100万トークン/秒を突破し三社の競争が激化。

2026.08.02
a white dice with the word amd on it
プロダクト & モデル報道

AMD Advancing AI 2026でEPYC 9006「Venice」発表、エージェントAI時代のサーバー性能競争が新局面に

AMDが2026年7月23日、EPYC 9006「Venice」を発表。Framework Desktopは192GB統合メモリでDeepSeek V4-Flashを動作させ、AIハードウェア性能競争が加速している。

2026.07.24
中国発Kimi K3がフロントエンド開発ベンチマークで首位に、Claude・GPTとのスコア競争が新局面へ
プロダクト & モデル報道

中国発Kimi K3がフロントエンド開発ベンチマークで首位に、Claude・GPTとのスコア競争が新局面へ

中国Moonshot社のKimi K3がArenaのフロントエンドコーディング部門で首位を獲得し、Artificial Analysis Intelligence Indexでは総合3位に入った。一方PitchBookは、トークン単価が最も高い分析対象モデルが実際のタスク完遂コストでは最も安く、単価が最も安いモデルが完遂コストでは最も高くつくという逆転現象を報告した。

2026.07.23
a blue background with lines and dots
プロダクト & モデル確認済

Claude Mythos、サイバー攻撃を83.1%成功させる最強AIモデル - 月次パッチ体制の根本的見直しが急務

AnthropicのClaude Mythosが83.1%の成功率でサイバー攻撃を実行し、Cybenchで史上初の100%スコアを達成。従来数週間かかったエクスプロイト開発を数分に短縮し、月次パッチサイクルの限界を露呈させている。

2026.05.06
a blue background with lines and dots
プロダクト & モデル報道

2026年AI・機械学習技術の最新動向:RAG手法とスマートシステムの進化

2026年におけるAI・機械学習分野では、機械学習ベースの分析手法やAIバックエンドを搭載したスマートシステムが急速に進化。R0ARのSMART Wallet Version 3やGeneralist AIのGEN-1モデルなど、従来比3倍高速で99%の成功率を実現する技術が登場している。

2026.05.05