
Cloudflare、Kimi・GLMなどのフロンティアモデルをより速く安く安全に配信する取り組みを公開
CloudflareがKimiやGLMといった大規模言語モデルをGPUメモリの限られたリソースの中で配信するための工夫を紹介しました。KVキャッシュの量子化、モデル重みの圧縮、整合性チェックの追加という3つの手法を組み合わせることで、推論の高速化・コスト削減・安全性向上を同時に目指しているとのことです。
トピック別に新着順で読めます。「あのアップデート何だっけ」はキーワード・期間からも探せます。

CloudflareがKimiやGLMといった大規模言語モデルをGPUメモリの限られたリソースの中で配信するための工夫を紹介しました。KVキャッシュの量子化、モデル重みの圧縮、整合性チェックの追加という3つの手法を組み合わせることで、推論の高速化・コスト削減・安全性向上を同時に目指しているとのことです。
Vercelが提供するAIエージェント向けスキル共有サービス「skills.sh」に、複数のスキルをひとまとめにして配布できる「スキルパック」機能が追加されました。単一のURLでの共有や、GitHub組織単位でのチーム標準化に利用できます。パックはコミュニティのスキルからも、ローカルフォルダやGitHubリポジトリからも作成可能です。
OpenAIが公式サイトで「Third-party cyber evaluations involving OpenAI models」と題する記事を公開し、モデルのサイバー領域における外部機関による評価の存在を取り上げました。同記事はHacker Newsでも話題となり、44ポイント・7件のコメントを集めています。具体的な評価内容の詳細は限定的ですが、AIモデルの安全性評価に関する透明性への関心の高さがうかがえます。
中国AI企業inclusionAIが、総パラメータ124B・活性化パラメータ5.1BのハイブリッドMoEモデル「Ling-3.0-flash」をHugging Faceで公開しました。従来の1兆パラメータ級フラグシップと同等以上の性能を、わずかな計算コストで実現しているのが特徴です。SGLangやvLLMでの推論に対応し、エージェント向けの長時間対話でも高速化が図られています。

Elastic社は、画像・音声・動画・PDFを取り込み時に自動でベクトル化する新フィールドタイプ「semantic field」を発表しました。テキスト用の semantic_text と同じ操作感で、テキストによる画像検索や画像による動画検索といったマルチモーダル検索が1つのフィールドで実現できます。Elasticsearch 9.5とServerlessでテクニカルプレビューとして提供されています。

GitHub Copilotに、Googleの最新Flashモデルである**Gemini 3.6 Flash**の提供が順次開始されました。Web・アプリ開発やコーディング、長時間にわたる自律型のエージェントタスクを想定して設計されたモデルです。

MicrosoftはAgent Frameworkの新機能「Harness」を正式リリースしました。プランニング、メモリ管理、コンテキスト管理、承認フロー、テレメトリなどをまとめて提供する実行基盤で、Python・.NET双方で利用できます。開発者はモデルと指示、ツールを渡すだけで、本格的な自律エージェントを構築できるようになります。

AWSはAmazon DynamoDBにおけるベクトル検索機能の一般提供(GA)を発表しました。運用データと同じテーブルにベクトル埋め込みを保存し、専用のベクトルデータベースへのデータ複製や同期パイプラインなしに類似検索を実行できます。単一桁ミリ秒のレイテンシとサーバーレスな自動スケーリングを備え、RAGや推薦エンジンなどの構築が容易になります。
Next.js 16.3が公開され、シングルページアプリケーションの体感速度を高める新機能「Instant Navigations」が導入されました。あわせて開発サーバーとビルドの高速化、AIエージェント向けツールの改善も行われています。

Cloudflareは社内で運用してきたAIエージェント基盤「Cloudflare OS」の新バージョンをオープンソースとして公開しました。エージェント・アプリ・セキュリティ制御を統合したプラットフォームで、企業が自社のシステムに接続してカスタマイズできます。GitHubで即日利用可能です。

Google DeepMindが公式ブログで、Geminiシリーズの新モデルとして「Gemini 3.6 Flash」「Gemini 3.5 Flash-Lite」「Gemini 3.5 Flash Cyber」の3種を発表しました。現時点で公開されている情報はモデル名の告知にとどまり、詳細な仕様や機能は明らかにされていません。

Google DeepMindは公式ブログで、新たなGeminiモデルとして「Gemini 3.6 Flash」「3.5 Flash-Lite」「3.5 Flash Cyber」の3つを発表しました。発表時点では新モデルの投入がアナウンスされたのみで、性能や利用開始時期などの詳細情報は公開されていません。

Cloudflareは、自社プラットフォーム上にデプロイされたAIエージェントのセッションを一つの画面にまとめて可視化する新機能「Cloudflare Agents」を発表しました。エージェントが大規模に稼働する際の挙動や重要な情報をひと目で把握できるようになります。詳細な機能仕様は今後の続報が待たれる段階です。

Cloudflareは社内のエンジニアリング標準をまとめた「Cloudflare Codex」を整備し、開発ライフサイクル全体でAIエージェントに参照させる取り組みを発表しました。構造化されたRFCとエージェントによるレビューを組み合わせることで、コード・仕様書・インシデントレポートの一貫性を自動的に維持します。
OpenAIの公式ブログに「We built a realtime system for responsive voice AI in six months」と題する記事が掲載され、Hacker Newsで話題になりました。タイトルとURLから、連続的な音声対話を実現する仕組み(GPT Live関連)を6か月で構築したことが示唆されていますが、公開されている本文情報は限定的です。

GitHubは、Issueコメントやプルリクエストコメントの作成をトリガーにしてCopilotのクラウドエージェント自動化を実行できる新機能を発表しました。ドキュメント生成などのユースケースが想定されており、開発者はコメント操作だけでCopilotの処理を呼び出せるようになります。
OpenAIは、AIとの連続的な音声対話を可能にする新システム「GPT-Live」を発表しました。従来の話者交代を前提としない「ターンレス音声モデル」と低遅延アーキテクチャにより、より自然でスムーズな会話体験を目指しています。
OpenAIの公式ブログに「GPT-5.6 fuses frontier intelligence with frontier efficiency」と題する記事が掲載されたことが、Hacker News経由で確認されました。ただし本稿執筆時点で参照できた原文情報はタイトルのみで、具体的な性能や価格、提供時期などの詳細は明らかになっていません。
LangChainのAnthropic統合パッケージ「langchain-anthropic」がバージョン1.5.0に更新されました。主な変更点は、reasoning_effortをチャットモデルの標準パラメータとして扱えるようになったことです。前バージョン1.4.8からの差分として、複数のPRがマージされています。

NVIDIAがHugging Face Blogに「The State of Simulation for Physical AI: An Overview」というタイトルの記事を公開しました。ロボットや自律システムなど、物理世界とやり取りする『Physical AI』領域におけるシミュレーション技術の全体像を概観する内容とみられます。今回参照した原文には本文が含まれておらず、詳細な内容は確認できませんでした。