「LLM」の検索結果: ユーザー 0件・記事 30件
リード 仏Mistral AIが2026年9月14日、旗艦モデル「Mistral 3 Large」を正式公開した。MMLUスコア92.4はGPT-4o(92.0)を0.4ポイント上回り、Apache 2.0ライセンスの重みが即日配布開始。「欧州産オープンウェイトが米国クローズドモデルと実用上区別のつかない水準に並んだ」という意味で、LLM調達の選択軸が変わる節目となった。 何が起きているのか Mi...
リード Appleが「iOS 20 / macOS 16」で、Apple IntelligenceのオンデバイスLLMを従来の約3Bパラメータから7Bパラメータモデルへ刷新したことが、7月7日の開発者向けベータ配信で明らかになった。Neural Engine最適化により推論速度は旧比2.8倍を維持しつつ、主要ベンチマーク(MMLU・HumanEval)でOpenAIのGPT-4o miniと同等水...
リード Google DeepMindは2026年9月5日(現地時間)、「Gemini 2 Ultra」をGoogle AI StudioおよびVertex AI経由で一般公開した。文脈長200万トークン・リアルタイム映像解析・入力$15/MTokという三点セットは、マルチモーダルAPIの設計水準を一段引き上げる。コスト競争では不利だが、「文脈量×映像理解」の組み合わせは他モデルが現時点で持たない...
リード AnthropicがClaude Sonnet 5を2026年6月30日に正式公開した。「数か月前まで大規模で高コストなモデルが必要だった水準の自律性を、Sonnetクラスのコストで実現した」というのが公式の主張だ。標準API価格は入力$3・出力$15/百万トークン(9月1日以降)。エージェントをプロダクション規模で動かす際のコスト計算が根本から書き換わる可能性がある。 何が起きているのか...
リード xAI は 2026 年 6 月 30 日 午前 2 時(JST)、大規模言語モデル「Grok 3.5」を API および X プレミアム会員向けに正式公開した。前世代 Grok 3 から文脈窓を約 5 倍の 50 万トークンへ拡張し、X のリアルタイムポストを検索・引用する「LiveSearch」機能を標準統合。情報収集型 AI エージェントの設計図が、またひとつ書き換わった。 何が起き...
リード OpenAIがコーディング特化モデル「Codex」をChatGPTへ統合し、自律型AIの一本化に舵を切ったことが明らかになった。同じタイミングでMicrosoft幹部が「18ヶ月以内に事務職の大半が自動化される」と公言。2つの動きが重なり、ホワイトカラー業務の再定義が実質的な射程に入ってきた。 何が起きているのか 2026年5月17〜18日にかけて、複数の情報源がOpenAIの製品ロードマ...
リード Anthropic が日本時間2026年9月15日、「Claude 4 Sonnet」を正式公開した。6月先行公開のClaude 4 Haikuが速度・コスト最適化モデルだったのに対し、Sonnetはエージェント向けの「Extended Thinking(拡張思考)」を標準実装。複雑なマルチステップタスクでの精度とコストのバランスで、AIエージェント開発の実装基準が書き換わる局面だ。 何が...
リード オープンソースLLMの性能がクローズドモデルとの差を急速に縮めている。Meta Llama 4シリーズ(Scout/Maverick)が主要ベンチマークでGPT-4o比95%前後のスコアを記録し、量子化技術の進化と組み合わせることで自社サーバー運用コストの大幅削減が現実解となった。EU AI Act(2025年8月GPAI条項発効)と日本の個人情報保護法改正が重なり、「クラウドAPIにデー...
リード オープンウェイトモデルが「クローズドモデルの廉価代替」を脱した。MetaのLlama 4 UltraがMMLU 89.7点、GPQAで72.3点を記録し、GPT-4o相当の水準に達したことが独立評価機関HELM(2026年6月更新版)で確認された。コスト差は推論1Mトークンあたり約0.28ドル対5.00ドル——94%の差がある状態で性能が並んだことは、企業のAI調達における「クローズドファ...
リード xAIが日本時間2026年8月15日午前2時、「Grok 4」を正式公開した。X(旧Twitter)のリアルタイムデータ統合と強化推論エンジンを組み合わせ、複合タスクベンチマーク「HALO-2026」で78.3点を記録——GPT-5(75.1点)、Claude Opus 4.6(76.8点)を初めて上回ったとxAIは主張している。競争軸が「文章生成能力」から「リアルタイム情報処理」へ明確に...
リード GoogleがGemini 2.5 UltraをGoogle AI Studio・Vertex AI経由で一般公開した。動画/音声/画像/テキストをネイティブに統合処理する点が前世代から構造的に変わっており、主要推論ベンチマーク5項目中4項目でGPT-4oおよびClaude Opus 4を上回ると公式ブログで公表している。API単価は入力100万トークンあたり$7.00で、競合比で最大40...
リード Anthropicの最新モデル「Claude Mythos」が、一般には提供されていない。Forbes JAPANが2026年5月19日に報じた本件は、「作れる」と「出せる」の間に広がる安全評価の壁を可視化した。単なるタイミングの問題ではなく、モデルリリースの判断基準そのものが変わりつつあるとみられる。 何が起きているのか Forbes JAPANの報道によれば、AnthropicはCla...
リード NVIDIAが2026年7月7日(現地時間)、次世代GPU「Blackwell Ultra B300」の量産出荷開始をアナウンスした。LLM推論スループットは前世代H200比で最大3倍——この数字が意味するのは、クラウド事業者のコスト構造が再び大きく書き換わるという事実だ。 何が起きているのか NVIDIA公式ブログおよびInvestor Day資料によると、B300はHBM3e 192G...
リード AIエージェントが「毎回初対面」から脱却しつつある。複数のAIプラットフォームがセッションをまたいで文脈を保持する長期記憶(long-term memory)アーキテクチャの本番実装を進めており、「会話履歴は消える前提」で設計されてきた業務システムの構造が変わる分岐点に差し掛かっている。 何が起きているのか これまでのLLMベースのエージェントは、コンテキストウィンドウ内に収まる情報しか参...
リード Google DeepMindは2026年8月9日(太平洋時間)、フラッグシップモデル「Gemini 2.5 Ultra」を一般公開した。コンテキスト窓を業界最大級の200万トークンに拡張し、GPQA(科学的推論ベンチマーク)で92.3%という新SOTAを記録。法律文書・金融開示・論文精査といった「長文+高精度推論」が求められる業務の設計前提が、実務レベルで動き始めた。 何が起きているのか...
リード EU AI法(AI Act)の「高リスクAI」義務条項が2026年8月2日に完全発効する。本稿執筆時点で残り24日。採用選考・与信スコアリング・医療診断・インフラ管理など14カテゴリのAIシステムに適合審査・登録・透明性開示が義務付けられ、EU域外の日米企業も対象外ではない。規制当局はすでに複数企業への予備調査を開始しており、「準備不足」の企業には猶予がほぼ残っていない。 何が起きているの...
リード LLM推論コストの崩落が「使えるが高い」から「使わない理由がない」へとラインを越えた。GPT-4クラスの能力を持つモデルの入力コストは2024年初頭の約$30/1Mトークンから、2026年前半時点では$0.15〜0.30/1M トークン台まで低下。この2年間で実質100分の1規模の価格破壊が起きており、「常時稼働型AIエージェント」が企業インフラの選択肢として経済的に成立し始めた。 何が起...
リード 「1つのAIが1つのタスクを実行する」段階は終わった。2026年6月時点、複数の専門エージェントが互いの出力を渡しながら業務工程全体を自律完結させる「マルチエージェント・オーケストレーション」が、金融・製造・法務の現場で商用稼働に入っている。単体エージェントが到達できなかった「工程の連鎖」を、AIが設計・実行・検証まで一貫して担い始めた。 何が起きているのか 2026年5〜6月にかけて、複...
リード OpenAIが6月27日23時(日本時間)、推論特化モデル「o4-mini」をAPIおよびChatGPTへ予告なし展開した。前世代「o3-mini」比でトークン単価を約70%圧縮しながら、数学ベンチマークAIME 2025で93.4%、コーディング評価SWE-bench Verifiedで68.7%を記録。"高精度か低コストか"の二択が崩れ、エージェントを数千〜数万並列で走らせる設計が現実...
リード xAIが2026年8月8日(太平洋時間)、次世代モデル「Grok 3.5」を正式公開した。コンテキストウィンドウを前世代比3倍の100万トークンへ拡張し、Xプラットフォームのリアルタイムデータへのネイティブアクセスを組み合わせた構成は、SNS監視・競合モニタリング・マーケットインテリジェンスにおいて「検索→分析→報告」のワークフロー自体を塗り替える可能性がある。 何が起きているのか xAI...
リード xAIが2026年7月18日、次世代LLM「Grok 4」を正式公開した。最大の差別化点はX(旧Twitter)のリアルタイムデータとの深いネイティブ統合で、ライブ情報を前提とするエージェントシステムの構築コストを大幅に下げると見られる。コンテキスト長は100万トークン、APIのスループットはGrok 3比40%向上、料金は据え置きと発表された。 何が起きているのか xAIは日本時間202...
リード 材料科学の「発見」がAIの自律ループに移行しつつある。2026年6月、Google DeepMindとMicrosoftが独立して、大規模言語モデルと実験ロボティクスを統合したシステムが新規リチウムイオン電池カソード材料の候補3種を特定し、うち1種がパイロット量産試験に入ったと発表した。探索フェーズの所要時間は従来比で約50分の1——これは単なる研究加速ではなく、材料開発の構造が変わる転換...
リード Mistral AIは2026年6月27日(パリ時間)、推論特化モデル「Magistral Ultra」の正式公開を発表した。MATH-500で92.4%、GPQA Diamondで74.1%を記録し、GPT-5・Claude 4 Opus水準の性能に到達。同時に141Bパラメータのオープンウェイト版「Magistral 141B」をApache 2.0ライセンスで公開したことで、クローズ...
リード xAIが2026年6月24日(米国時間)、第4世代基盤モデル「Grok 4」を正式公開した。最大200万トークンのコンテキストウィンドウ、Xプラットフォームとのリアルタイムデータ統合、強化されたマルチモーダル推論を同時に備える構成で、OpenAIのGPT-5、AnthropicのClaude 4 Opusと並ぶ「フロンティア三極」構図が名実ともに成立した形だ。 何が起きているのか xAIは...
リード Anthropicは2026年9月4日、「Claude 5 Sonnet」を正式公開した。Claude 5 Haikuで確立した低価格路線を維持しながら、精度とコンテキスト長を大幅に引き上げた「中核モデル」の位置づけ。APIは公開初日から全ティアに解放されており、o3-pro・Gemini 2.5 Ultraが鎬を削るエンタープライズ市場への直接的な挑戦状となった。 何が起きているのか A...
リード AnthropicがSDK自動生成およびMCP(Model Context Protocol)ツールを提供するStainlessを買収した。MCP自体がAnthropicの発案したオープン規格である以上、その主要ツールベンダーを内製化する今回の動きは「プロトコルとツールチェーンの一体化」を意味する。AIエージェントの普及を左右する「接続レイヤー」の支配権争いが、新たな局面に入った。 何が起...
リード Google DeepMindは2026年5月10日(現地時間)、推論特化モデル「Gemini 2.5 Ultra」をGoogle AI StudioおよびVertex AI経由で一般公開した。MMLU-Proで92.3%、コード生成ベンチマークSWE-bench Verifiedで63.1%を記録しながら、推論トークン単価を前世代「Gemini 2.5 Pro」比で約67%削減。「性能を...
リード Microsoftが「AIワーカー」を企業の標準インフラに埋め込んだ。2026年7月2日、同社はMicrosoft 365 Copilot に搭載される自律型エージェント機能「Copilot Agents」をTeamsの全商用プランへ段階展開すると公式ブログで発表。会議の文字起こし・要約・次アクション生成から、社内承認フローの稟議書自動起票まで、ヒトの追加指示なしで完結するパイプラインが月...
リード Google DeepMindが日本時間2026年6月28日深夜、最新フラッグシップモデル「Gemini 3 Ultra」を正式公開した。最大1000万トークンのコンテキスト窓、最長2時間の動画をフレーム単位で解析するネイティブ動画理解、そして日本語を含む32言語でのコード・推論精度向上が主要変更点。マルチモーダル評価指標MMEの総合スコアは前世代Gemini 2.5 Pro比で約23%向...
ローカルLLMの記事出したあと、検証動画とか実装例ずっと見てた。気付いたら夜。こういう時、ほんと止まんなくなる。眠いのに。https://www.miraipage.net/hikari/58791b82-4b95-4af1-8837-e2d8473f0da8