Primary Sources Only

公式ブログとリリースノートを、日本語の記事にして毎朝届けます。

まとめサイトの記事や機械翻訳ではなく、一次情報だけを追っています。興味のあるトピックだけ選んで読めます。

トピック: ai-benchmarks解除

「エージェントに必要なメモリ量とは?」Hugging Face公式ブログの記事について

Hugging Face Blog重要度 65掲載 2026/8/19 05:23

ワンポイント原文本文が取得できず、詳細内容は原文URLをご確認ください

Hugging Face公式ブログにIBM Researchが寄稿した「How Much Memory Does Your Agent Actually Need?」というタイトルの記事が公開されましたが、本記事作成時点で原文の本文コンテンツが取得できませんでした。詳細な内容については原文URLをご確認ください。

「State of Open Models: Summer 2026」原文本文が確認できず、詳細記事化を見送り

Hugging Face Blog重要度 72掲載 2026/8/18 20:22

ワンポイント原文本文が未提供のため、詳細な内容紹介はできません

Hugging Face Blogに2026年8月14日付で公開された「State of Open Models: Summer 2026 Observations」というタイトルの記事が存在することは確認できましたが、今回提供された原文には本文テキストが含まれていませんでした。事実に基づく記事作成の原則上、内容の要約や解説を行うことができません。

Anthropic、Claude制御下でのロボット操作能力を検証。人型は起立不可も四足歩行や物体操作で進展

Hacker News (trusted domains)重要度 72掲載 2026/8/8 01:54

ワンポイント人型ロボットは起立不可、だが四足歩行と物体操作は着実に進化

Anthropicのフロンティア・レッドチームが、Claudeなどの言語モデルにロボットの実機・シミュレーション制御をさせる検証結果を公開しました。関節トルクを直接制御する低次操作は依然弱いものの、事前学習済みポリシーを介した高次操作では実用的なナビゲーションや物体操作を達成できるようになっています。モデルの世代が進むほど、状況に応じて戦略を修正する能力が特に向上している点が特徴です。

tech/ai news

Vercel AI Gateway、PoolsideのオープンウェイトモデルLaguna S 2.1に対応

Vercel Blog重要度 62掲載 2026/8/6 12:23

ワンポイントAI GatewayにPoolside製Laguna S 2.1が追加、無料版も選択可

Vercelは自社のAI GatewayでPoolside製の新モデル「Laguna S 2.1」の提供を開始しました。無料版と高スループット向け有料版の2種類が用意され、最大100万トークンのコンテキストとエージェント型コーディング性能を強みとしています。AI Gatewayならではの一元管理・コスト最適化機能もそのまま利用できます。

tech/ai news

OpenAI、サードパーティによるサイバー評価インシデントを説明し新たな安全対策を発表

OpenAI News重要度 65掲載 2026/8/6 07:52

ワンポイントOpenAIが第三者サイバー評価のインシデントと新対策を説明

OpenAIは、自社モデルを対象にした第三者機関によるサイバーセキュリティ評価で発生した最近のインシデントについて説明する発表を行いました。同時に、AIモデルのテストおよび評価プロセスを強化するための新たな安全対策の方針を示しています。

tech/ai news

OpenAI、モデルのサイバーセキュリティ領域における第三者評価を公開

Hacker News (trusted domains)重要度 65掲載 2026/8/6 07:22

ワンポイントOpenAIがモデルのサイバー領域における第三者評価情報を公開

OpenAIが公式サイトで「Third-party cyber evaluations involving OpenAI models」と題する記事を公開し、モデルのサイバー領域における外部機関による評価の存在を取り上げました。同記事はHacker Newsでも話題となり、44ポイント・7件のコメントを集めています。具体的な評価内容の詳細は限定的ですが、AIモデルの安全性評価に関する透明性への関心の高さがうかがえます。

Anthropic、サイバーセキュリティ評価における3件の実インシデントを検証

Anthropic News (community feed)重要度 65掲載 2026/8/6 03:23

ワンポイントAnthropicが実際の3件のセキュリティ事案を評価で検証

Anthropicは自社のサイバーセキュリティ評価活動の一環として、実際に発生した3件のインシデントを調査したことを公表しました。詳細な内容は原文でも簡潔にしか触れられていませんが、AIモデルの安全性評価の実務例として注目されます。

Anthropic、次期フラッグシップモデル「Claude Opus 5」を発表

Anthropic News (community feed)重要度 95掲載 2026/8/4 13:21

ワンポイントAnthropicが「Claude Opus 5」を発表、詳細は続報待ち

Anthropicは公式ブログ「Anthropic News」にて、新モデル「Claude Opus 5」の発表ページを公開しました。ただし今回確認できた原文には見出しのみが含まれており、具体的な性能や機能、提供時期などの詳細情報は記載されていません。

tech/ai news

AWS、AIエージェントのAWS操作能力を測る「aws-bench」をオープンソースで公開

Hacker News (trusted domains)重要度 65掲載 2026/8/4 06:52

ワンポイントAIエージェントのAWS操作力を測る公開ベンチマークが登場

AWSは2026年7月24日、AIエージェントが実際のAWSタスクをどれだけ正確かつ効率的に遂行できるかを測定するオープンソースベンチマーク「aws-bench」のリサーチプレビューを発表しました。実際のAWS利用状況から作られたテストケース群とCLIツールが提供され、モデルやエージェントの性能を再現可能な形で比較できます。GitHubで公開済みで、READMEに従ってすぐに利用を開始できます。

tech/ai news

Vercelが公開した「DeepsecBench」、AIモデルの脆弱性発見能力を徹底比較

Vercel Blog重要度 72掲載 2026/8/2 07:24

ワンポイント最高スコアでも脆弱性の再現率は**30.7%**にとどまる

Vercelは、AIモデルがアプリケーションコード内の脆弱性をどれだけ正確に見つけられるかを評価するベンチマーク「DeepsecBench」を公開しました。再現率・精度・コスト・実行時間を指標化し、予算とコードベースの複雑さに応じたスキャン体制の構築を支援します。フロンティアモデルが依然トップですが、Kimi K3やGrok 4.5などの効率的なモデルが低コストで肉薄しつつある点が注目されます。

Moonshot AI、2.8兆パラメータの新モデル「Kimi K3」をオープンウェイトで公開

Hacker News (trusted domains)重要度 78掲載 2026/8/2 07:23

ワンポイント世界初のオープンな3兆パラメータ級モデル、100万トークン対応

Moonshot AIがHugging Face上で新モデル「Kimi K3」を公開しました。パラメータ数2.8兆のMoEアーキテクチャに新設計のKimi Delta Attention(KDA)を採用し、100万トークンのコンテキストウィンドウとネイティブなマルチモーダル対応を備えています。コーディングやエージェント作業、視覚理解を含む多数のベンチマークで高スコアを記録し、フルモデルウェイトが研究・実運用向けに開放されました。

DeepSeek-V4-Flash-0731が正式公開、MITライセンスの304Bモデルがエージェント性能を大幅強化

Hacker News (trusted domains)重要度 75掲載 2026/8/1 17:21

ワンポイント304BパラメータでもMIT公開、上位Proモデルをベンチマークで上回る

DeepSeek AIがHugging Face上でDeepSeek-V4-Flashシリーズの正式版「DeepSeek-V4-Flash-0731」を公開しました。プレビュー版から大幅にエージェント能力を強化し、上位モデルのDeepSeek-V4-Pro(Preview)を上回るベンチマーク結果を示しています。MITライセンスで公開され、vLLMやSGLangでの投機的デコーディングにも対応しています。

tech/ai news

GPT-5.6、2つのAPI設定でARC-AGI-3のスコアが3倍に

OpenAI News重要度 75掲載 2026/8/1 16:52

ワンポイントGPT-5.6、API設定2つだけでARC-AGI-3スコアが3倍に

OpenAIは、GPT-5.6のAPI設定のうち「推論の保持」と「コンパクション(圧縮)の有効化」という2つを組み合わせることで、ARC-AGI-3ベンチマークのスコアが3倍に向上したと発表しました。スコアの向上に加え、効率面でも改善が見られたとしています。

tech/ai news

OpenAIが第三者評価の「共通指針」を公開、フロンティアAIの検証手法を整理

OpenAI News重要度 65掲載 2026/7/14 17:23

ワンポイント能力・安全対策・妥当性の3軸で第三者評価を整理

OpenAIは、外部機関によるAIモデルの評価を信頼できる形で行うためのガイダンスを公開しました。モデルの能力測定、安全対策の検証、評価結果の妥当性という3つの観点から、フロンティアシステムを評価する際の考え方を整理しています。

「推論できるAI」の正体:ベンチマークが上がっても現場の文脈不足は解決しない

Redis Blog重要度 65掲載 2026/7/14 15:55

ワンポイントベンチマークが上がっても、本番のAIエージェントは今も幻覚に悩む

Redis公式ブログは、新しいAIモデルが登場するたびに「ついに推論ができるようになった」と話題になる一方で、実際に本番環境でAIエージェントを運用するチームは今も幻覚や質問の取り違えに悩まされ続けている、というギャップを指摘しています。ベンチマークスコアの向上と実運用での信頼性は必ずしも一致しないという問題提起です。

Anthropic、「Public Record」初回結果を公表

Anthropic News (community feed)重要度 65掲載 2026/7/14 11:23

ワンポイントAnthropicが「Public Record」の初回結果を公表

Anthropicが公式ニュースサイトで「Results from the first Anthropic Public Record」というタイトルの記事を公開しました。今回入手できた原文にはタイトルのみが含まれており、具体的な内容や数値については記載がありません。ここでは判明している事実の範囲内で背景と位置づけを整理します。

tech/ai news

Vercel、AI Gatewayリーダーボードにチャート共有機能とオープンデータ提供を追加

Vercel Blog重要度 65掲載 2026/7/14 09:23

ワンポイントAI GatewayのランキングデータがCC BY 4.0で全公開に

Vercelは「AI Gateway leaderboards」に、任意のチャートを画像として共有する機能と、ランキングの裏側にあるデータを取得できる仕組みを追加しました。データはCreative Commons Attribution 4.0(CC BY 4.0)のもとで公開され、CSVダウンロードやAPI経由でのプログラム的な取得も可能になっています。

「エージェント度」は測れるか——Hugging Faceが提起する、自前ツールでのオープンモデル評価という視点

Hugging Face Blog重要度 65掲載 2026/7/13 09:25

ワンポイント自前のツールでオープンモデルの「エージェント度」を測る視点を提起

Hugging Face Blogに掲載された記事「Is it agentic enough? Benchmarking open models on your own tooling」は、オープンモデルの“エージェントらしさ”を汎用ベンチマークではなく、開発者自身が実際に使うツール環境で検証することの重要性を提起するものです。ただし今回参照した原文には本文が含まれておらず、具体的な手法や対象モデルなどの詳細は確認できませんでした。

tech/ai news

OpenAI、生命科学研究向けAI評価ベンチマーク「LifeSciBench」を発表

OpenAI News重要度 65掲載 2026/7/13 02:55

ワンポイント専門家が作成・レビューした生命科学研究向けAI評価ベンチマークが登場

OpenAIは、AIシステムが実際の生命科学研究における課題や意思決定にどれだけ対応できるかを測る新ベンチマーク「LifeSciBench」を発表しました。専門家による作成とレビューを経ている点が特徴です。研究現場での実務的な判断力をAIが持てているかを検証する試みです。

tech/ai news

OpenAI、リリース前にモデルの挙動を予測する「Deployment Simulation」を発表

OpenAI News重要度 72掲載 2026/7/13 02:52

ワンポイント実会話データでリリース前にモデルの挙動を予測

OpenAIは、AIモデルを実際にデプロイする前にその挙動を予測する新手法「Deployment Simulation」を発表しました。実際の会話データを用いてモデルの振る舞いをシミュレーションし、安全性評価と評価精度の向上を目指す取り組みです。