Archive

記事アーカイブ

トピック別に新着順で読めます。「あのアップデート何だっけ」はキーワード・期間からも探せます。

すべて1294AI・LLM613セキュリティ368開発ツール258DevOps・CI/CD232OpenAI196Vercel171GitHub116Hugging Face100Cloudflare95Node.js / ランタイム95サーバーレス86データベース76Next.js76Redis73TypeScript68Anthropic64Python61Model Context Protocol60クラウド58フロントエンド58Kubernetes57AIベンチマーク49AWS49JavaScript49オープンソース49Google DeepMind48AI セキュリティ46Docker40Transformers39GitLab35LangChain35React31ベクトルデータベース27pnpm24テスト24Azure22Deno19PostgreSQL15PyTorch15Rust15Terraform13Django12Git12Go12Google Cloud12.NET12nginx12ロボティクス12Vite12Bun11Elastic10OpenTelemetry10Ruby10AIコンテキスト管理9mise9Nuxt9Supabase9Elasticsearch8Ollama8GraphQL7LLVM7Prisma7Prometheus7Vitest7vLLM7Erlang/OTP6Hono6Mojo6Svelte6Grafana5PHP5Playwright5Polars5Rails5Remix5Vue5LlamaIndex4Meilisearch4Astro3Bevy3Elixir3FastAPI3Foundation3モバイル3MobX3OCaml3RabbitMQ3TensorFlow3Turborepo3Zed3Airflow2Angular2Ant Design2Apache Kafka2Biome2Crystal2date-fns2DuckDB2esbuild2htmx2Hugo2Jaeger2Jenkins2JupyterLab2Mantine2Material UI2NumPy2Poetry2Qwik2Rolldown2SolidJS2uv2Webpack2ArgoCD1Celery1Dart1Drizzle ORM1Effect1Flask1Framer Motion1Godot Engine1Ionic1Jest1Jotai1Kotlin1Lodash1Lua1pandas1Pinia1pytest1Ruff1scikit-learn1shadcn/ui1Spring1SQLAlchemy1Storybook1TanStack Query1Zod1
tech/ai news

OpenAIが「CoT-Control」を発表、推論モデルは自らの思考過程を制御できないと判明

OpenAI News重要度 72掲載 2026/8/26 21:53

ワンポイント推論モデルは自分の思考過程を制御できず、それが安全性の裏付けに

OpenAIは新たな評価手法「CoT-Control」を用い、推論モデルが自身のチェーン・オブ・ソート(思考の連鎖)を意図的に制御することが難しいという結果を報告しました。同社はこの「制御できない」という性質こそが、AIの安全性を担保する「モニタリング可能性」を支える重要な要素だと位置づけています。

tech/ai news

OpenAIが「GPT-5.4 Thinking System Card」を公開

OpenAI News重要度 85掲載 2026/8/26 21:51

ワンポイント「GPT-5.4 Thinking System Card」公開、詳細は続報待ち

OpenAIが公式サイトにて「GPT-5.4 Thinking System Card」というタイトルの記事を公開したことが確認されました。2026年3月5日付でOpenAI Newsに掲載されていますが、本稿執筆時点では原文の本文内容が確認できていません。詳細が判明次第、続報をお伝えします。

tech/ai news

OpenAI、フロンティアLLMの「指示階層」を強化するIH-Challengeを発表

OpenAI News重要度 72掲載 2026/8/26 21:23

ワンポイントOpenAIのIH-Challengeでプロンプトインジェクション耐性が向上

OpenAIは、大規模言語モデルが信頼できる指示を優先的に扱えるようにする取り組み「IH-Challenge」を発表しました。これにより指示階層の遵守、安全性の制御性、プロンプトインジェクション攻撃への耐性が向上するとしています。対象は最先端のフロンティアLLMです。

Google DeepMind、AGIへの進捗を測る「認知的フレームワーク」を発表 Kaggleハッカソンも同時始動

Google DeepMind Blog重要度 75掲載 2026/8/26 20:21

ワンポイントDeepMindがAGI進捗測定の「認知的フレームワーク」を発表

Google DeepMindが、AGI(汎用人工知能)への進捗を測定するための新しい枠組みを発表しました。あわせて、この枠組みに基づく評価手法を構築するためのKaggleハッカソンも開始しています。

Google DeepMind、オープンモデル新版「Gemma 4」を発表

Google DeepMind Blog重要度 85掲載 2026/8/26 17:21

ワンポイントGemma 4は推論とエージェント処理に特化した最新オープンモデル

Google DeepMindがオープンモデルファミリーの最新版「Gemma 4」を発表しました。同社の説明によれば、これまでで最も高性能なオープンモデルであり、高度な推論とエージェント型ワークフローのために設計されているとのことです。

IBM Research発、AIエージェントの推論・ツール使用・失敗パターンを検証する「VAKRA」ベンチマーク

Hugging Face Blog重要度 65掲載 2026/8/26 16:54

ワンポイントIBM ResearchがAIエージェントの推論・ツール使用・失敗モードを分析

Hugging Face Blogに掲載されたIBM Researchの記事「Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents」を紹介します。AIエージェントの推論能力やツール使用、失敗モードを分析する「VAKRA」というベンチマークが取り上げられていますが、公開時点で確認できた原文情報は記事タイトルと出典情報のみで、具体的な評価手法や結果の詳細は本稿執筆時点では確認できていません。

tech/ai news

OpenAI、「GPT-5.5」のシステムカードを公開

OpenAI News重要度 92掲載 2026/8/26 06:21

ワンポイントGPT-5.5のシステムカードが公開、詳細は今後確認へ

OpenAIは公式サイトにおいて「GPT-5.5」に関するシステムカードのページを公開しました。今回参照した原文には本文テキストが含まれておらず、具体的な性能や安全性評価の詳細は確認できていません。詳細情報は公開ページの更新を待つ必要があります。

tech/ai news

「GPT-5.5 Instant System Card」、原文本文が確認できず詳細は不明

OpenAI News重要度 85掲載 2026/8/26 04:21

ワンポイント原文本文が未提供のため詳細不明、続報待ちです

OpenAI Newsに掲載された「GPT-5.5 Instant System Card」というタイトルの記事について、本記事作成時点で参照可能な原文本文が提供されていません。そのため具体的な機能や変更点、安全性評価などの内容をお伝えすることができません。続報や原文の内容が確認でき次第、改めて詳細をお伝えします。

tech/ai news

VercelのAI Gatewayデータが示す実態:支出はAnthropic首位、流通量はGoogleが首位という逆転現象

Vercel Blog重要度 72掲載 2026/8/26 02:52

ワンポイント支出はAnthropic首位、流通量はGoogle首位という逆転現象が判明

Vercelが自社の**AI Gateway**を通過した7か月分・200K超のチームの実運用データを分析したレポートを公開しました。支出額と処理トークン量ではランキングが逆転するなど、単一のベンチマークでは見えない「本番環境でのAI利用実態」が明らかになっています。

tech/ai news

Databricks、企業向けエージェントワークフローにGPT-5.5を採用

OpenAI News重要度 75掲載 2026/8/26 01:53

ワンポイントDatabricksがGPT-5.5をエージェントワークフローに採用

Databricksが、OpenAIの新モデル「GPT-5.5」を企業向けエージェントワークフローに導入したことが明らかになりました。同モデルはベンチマーク「OfficeQA Pro」で新たな最高スコアを記録しています。OpenAI Newsが公開した短い発表に基づく内容です。

Elasticsearch対Qdrant、再戦の結末は「同じ土俵なら互角」だった

Hacker News (trusted domains)重要度 65掲載 2026/8/22 18:24

ワンポイント設定を揃えると両者とも約56QPSで実質互角だった

Elastic Search Labsは、以前公開したElasticsearchとQdrantのベクトル検索ベンチマークについて、Qdrant側の反論(io_uringの非同期ディスクスコアラーやメモリ使用量の違い)を実際に検証しました。結果、両者の性能差の正体はディスクI/Oやメモリではなく、セグメント数と結果ID取得の仕組みにあることが判明しています。

Hugging Face、音声AIの「人間らしさ」を測る新指標『Real World VoiceEQ』を発表

Hugging Face Blog重要度 65掲載 2026/8/22 17:23

ワンポイント音声AIの「人間らしさ」を測る新指標が登場

Hugging Faceは公式ブログで、音声AIがどれだけ人間らしく聞こえるかを測定する新しい取り組み『Real World VoiceEQ』を発表しました。タイトルからは音声合成・音声対話AIの品質評価に関する新しい枠組みであることがうかがえますが、本記事執筆時点では詳細な本文内容が提供されていないため、具体的な評価手法や指標の詳細は不明です。

tech/ai news

OpenAI、自己対戦でAIの弱点を鍛える自動レッドチーミング「GPT-Red」を発表

OpenAI News重要度 72掲載 2026/8/22 15:53

ワンポイントAI同士の自己対戦でプロンプトインジェクション耐性を自動強化

OpenAIは、self-play(自己対戦)の仕組みを用いてAIモデルの安全性・アラインメント・プロンプトインジェクション耐性を高める自動レッドチーミングシステム「GPT-Red」を発表しました。人手に頼らずAI自身が弱点を探索し改善につなげる点が特徴です。

NVIDIA Nemotron 3 Embed、RTEBで総合1位を獲得 エージェント型検索の進化に貢献

Hugging Face Blog重要度 72掲載 2026/8/22 13:22

ワンポイントNVIDIA Nemotron 3 EmbedがRTEBで総合1位を獲得

Hugging Face Blogによると、NVIDIAの埋め込みモデル「Nemotron 3 Embed」がベンチマーク「RTEB」で総合1位にランクインしました。これはエージェント型検索(agentic retrieval)の発展を後押しする成果として紹介されています。

tech/ai news

Ora、Vercelの新エージェントフレームワーク「eve」を実サイトでベンチマーク

Vercel Blog重要度 65掲載 2026/8/22 07:23

ワンポイントVercelのeveがClaude Codeより実サイト成功率2倍を記録

AIエージェントが実際のWebサイトでサインアップや決済までこなせるかを検証するOraが、自社の検証基盤をVercel上に一本化し、Vercelのエージェントフレームワーク「eve」を他の主要ハーネスと同条件でベンチマークしました。結果を受けてeve自体も改善され、Oraは自社の内部エージェント開発にeveを採用しています。

tech/ai news

実行検証済みコード修復データセット公開、7Bモデルのバグ修正率が17%→40%に向上

Hacker News (trusted domains)重要度 68掲載 2026/8/22 03:22

ワンポイント最難関バグの修正率が7Bモデルで17%→40%に有意向上

Hugging Face上で「TrueSET/verified-code-repair」というコード修復データセットが公開されました。すべての正誤判定をLLMではなく実際のコード実行で行っているのが特徴で、Qwen2.5-7B-Instructを微調整したところ、最も難しい2ファイル横断バグの修正率が17.1%から40.0%へ統計的に有意に向上したと報告されています。評価スクリプトも同梱されており、GPU1台・約15分・1ドル未満で誰でも同じ結果を再現できます。

tech/ai news

ATARIからEVE Onlineへ——Google DeepMindが語る15年間のゲームAI研究

Google DeepMind Blog重要度 72掲載 2026/8/22 00:21

ワンポイントDeepMind、15年のゲームAI研究をスタジオとの協業に繋げる

Google DeepMindが公式ブログで、ATARIのゲームを用いた初期の強化学習研究からEVE Onlineとの協業まで、15年にわたるゲームAI研究の歩みを紹介しました。現在はゲームスタジオと提携し、新しいAIゲームプレイの試作に取り組んでいることが明らかにされています。

Supabase開発者アップデート2026年8月号:Pipelines公開アルファ、ChatGPT連携ベータ、統合ログなど盛りだくさん

Supabase重要度 72掲載 2026/8/21 23:25

ワンポイントSupabase PipelinesがBigQueryへのリアルタイムCDCを公開アルファで提供開始

Supabaseが2026年8月の開発者アップデートを公開しました。BigQueryへのリアルタイム同期を実現する「Supabase Pipelines」の公開アルファ版や、ChatGPTアカウントでのサインイン機能のベータ提供、全サービス横断のログ検索基盤「Unified Logs」など、多数の新機能が発表されています。あわせてExtensionのバージョン指定廃止やrealtimeスキーマの変更制限といった破壊的変更にも注意が必要です。

TutorMoments: AIチューターは「助ける時」と「待つ時」を見極められるか

Hugging Face Blog重要度 65掲載 2026/8/21 19:24

ワンポイントAIチューターに問われる「助ける」と「待つ」の判断力

AllenAI(Allen Institute for AI)がHugging Face Blogで公開した「TutorMoments」は、AIチューターが生徒に介入すべきタイミングとあえて手を出さず考えさせるべきタイミングを正しく判断できるかを問う取り組みです。今回参照できた原文情報はタイトルのみで、評価手法や結果などの詳細本文は確認できませんでした。

150Mパラメータの推論モデルがARC-AGI-1でコスト対精度の新記録を樹立

Hacker News (trusted domains)重要度 75掲載 2026/8/19 05:51

ワンポイント150Mモデルが1タスク0.0007ドルでARC-AGI-1の効率記録を更新

Pathwayの研究チームは、文脈内学習と再帰的な潜在空間推論を組み合わせた150Mパラメータのモデル「BDH-CQ」を発表しました。ARC-AGI-1評価セットにおいて、1タスクあたり0.0007ドルという低コストでpass@2 29.5%を達成し、従来報告されていたコスト対精度のパレートフロンティアを更新しました。