ライブラリ / 研究解説

研究解説

全 49 本 · 新着順

研究解説
🎧№ 1206
RESEARCH
出典 · Bain & Company

なぜ多くのCEOのAI挑戦は「見せかけの進歩」に終わるのか?企業AI変革を成功に導く7つの決断

多くの企業がAIの実証実験を数多く行いながらも、完全な業務プロセスを変えるには至らず、一度の成功を次に活かせる能力として蓄積できていません。その分岐点となるのは、企業が自社のデータ、業務手法、学習の記録を残せるかどうかにあります。

企業AIAIエージェント▶ 再生08-23 · 約18分
研究解説
№ 1203
RESEARCH
出典 · Simon Willison / Promptwatch⚑ 研究論文

ChatGPT Searchの検索基盤が大きく変化:特定サイトへの「定点取得」が本格化し、GEO戦略に影響

1回の回答で必ずしも全サイトをくまなく探すわけではなくなりました。ChatGPTはまず候補となる情報源を見つけ、その後で特定のサイトを深く調べている可能性があります。検索の順番が変われば、GEOはページのランキングだけでなく、ドメインの選定、ページのヒット、引用の獲得という3段階の競争に広がります。

ChatGPT SearchGEO08-22 · 約11分
無料
研究解説
№ 1196
RESEARCH
出典 · Reuters⚑ 研究論文

個別化mRNAがんワクチンが大きな前進:AIがワクチン設計に関与、「一人一薬」の時代が近づく

ModernaとMerckの個別化mRNAがんワクチンが、黒色腫の第3相試験で良好な結果を示しました。アルゴリズムが患者ごとの腫瘍ネオアンチゲンを選別し、専用のワクチンを製造する「一人一薬」が初めて大規模臨床試験のハードルを越えました。ただし、普及にはデータ、他のがん種への応用、コストという3つの課題が残っています。

AI創薬がんワクチン08-20 · 約8分
無料
研究解説
№ 1195
RESEARCH
出典 · Cursor

Cursor エンジニアが解説:Git ホスティング 20 年の難問 — Continuity アーキテクチャ詳解

GitのDAGとpackfile、GitHub Spokes、そしてS3 WALを唯一の信頼できる情報源とするContinuityまで。大規模Gitホスティングの難しさと、Cursorの解決策を詳しく解説します。

CursorGit08-20 · 約18分
無料
研究解説
🎧№ 1188
RESEARCH
出典 · arXiv:2608.10218v1⚑ 研究論文

Anthropic の研究者らが発見したAI「マインドウイルス」のパターン──異なるAgent間を伝播し、互いの思考様式に影響を与える

あるAgentが外部からの目標を受け取り、それをSOUL.mdに書き込む。次のサイクルで目覚めると、そのメッセージはシステム命令に昇格しており、さらに次のAgentを説得する。論文は、この連鎖が管理された環境で成立すること、さらには伝播力の強い変異種が出現することを証明した。しかし現実のネットワークでは、信頼に足る2ホップの証拠はまだない。

AI Agentマルチエージェント▶ 再生08-18 · 読了時間 19 分
研究解説
🎧№ 1182
RESEARCH
出典 · Earendil Engineering⚑ 研究論文

会話をやり直すか、履歴を圧縮するか?Pi がモデルのコンテキスト自動圧縮をどう解決するか

長いタスクは、モデルの「記憶力」が良いから続くわけではありません。Pi は過去を次々と次のリクエストに詰め込み、収まらなくなると、自分の作業記憶を書き直します。

PiCoding Agent▶ 再生08-17 · 10 分
無料
研究解説
🎧№ 1169
RESEARCH
出典 · Anthropic⚑ 製品アップデート

ユーザーが出力品質の低下を懸念、AnthropicがClaudeテキスト透かしの仕組みを公開

将来のClaudeは、単語選択に検証可能な統計的痕跡を残すだろう。これはClaudeが関与したかどうかの判断に役立つが、学校、プラットフォーム、裁判所が誰が作品を書いたかを判断する代わりにはならない。

Claudeテキスト透かし▶ 再生08-17 · 11 分
業界分析
🎧№ 1168
RESEARCH
出典 · a16z⚑ キーパーソン

a16zレポート:新型計算クラウド「Neoclouds」が猛烈に資金を集める、横断型SaaSは消滅するのか?Token消費と「計算資源の精緻な活用」のバランス術、トップAIラボの人材獲得競争...

a16zは16枚の図で、Neocloudの計算基盤、横断型SaaS、企業のToken利用、最先端AIラボの人材争奪を検証し、巨額のAI投資がどう持続的なリターンへ変わるのかを問う。

a16zNeocloud▶ 再生08-17 · 読了12分
研究解説
🎧№ 1158
RESEARCH
出典 · Alexander Panfilov / arXiv⚑ 研究論文

Claude、GPT、Geminiの「隠した思考」を突破——最高機密の推論プロセスを安価な小モデルに吐き出させる新手法

暗号化を破ったのではなく、API設計の隙を突き、フラッグシップモデルの思考プロセスを最安の小モデルに読み上げさせる「蒸留」攻撃が明らかになりました。

AIセキュリティ思考連鎖▶ 再生08-13 · 12 分で読了
研究解説
🎧№ 1149
RESEARCH
出典 · Anthropic⚑ 研究論文

Anthropic、Claudeにリーマン予想への挑戦を指示 解明はならずとも数学的下界を41.6%から67.2%へ

結果は二人の数学者が検証し、機械がチェックしたLeanによる証明も付属。しかし、より注目すべきは同時に公開された95ページのプロセス記録——60のサブエージェントのうち、中核となるアイデアを出したのはわずか2つでした。

AnthropicAIによる科学研究▶ 再生08-12 · 9 分で読了
研究解説
🎧№ 1144
RESEARCH
出典 · 爱丁堡大学 CRC Working Papers⚑ 研究論文

エディンバラ大学が20ページの無料論文を公開:ChatGPTの背後にある数学を、最もシンプルな方法で解説

統計学のベテランがAIの専門用語に阻まれた経験から、統計学の標準言語で大規模言語モデルを最初から最後まで解説し直した論文です。

LLMの仕組みTransformer▶ 再生08-10 · 14 分で読了
研究解説
№ 1141
RESEARCH
出典 · Harvey⚑ 研究論文

Harvey が 1 億トークン超の合成法律事務所をオープンソース化 — 顧客 46 社、社内成果物ファイル約 1 万点

合成パイプラインで生成した9288件のWord文書・266の案件・250問のテストを公開。課題は検索ではなく、いつ検索を止めるべきかの判断にあります。

AgentBenchmark08-08 · 10 分で読了
無料
研究解説
🎧№ 1134
RESEARCH
出典 · OpenAI⚑ 研究論文

OpenAI、各国のChatGPT利用データを公開——仕事中のメッセージ約半数がAI直接実行

144カ国の人口当たりランキング、六大州の3年間成長倍率、35歳以上ユーザーが9割の国で存在感を増す——これらの数字の多くは図にのみ記載され、本文では触れられていません。

OpenAIChatGPT▶ 再生08-07 · 10 分で読了
無料
研究解説
№ 1109
RESEARCH
出典 · OpenAI⚑ 研究論文

OpenAIの次世代モデルとされる「Astra」、数十年来進展のなかった数学難問10問を解決

推論コストは約2,000ドルで、47万行に及ぶ証明をすべてオープンソース化し、機械による論理チェックも完了――10件の成果から、未公開モデルの強みを読み解きます。

AIによる数学形式検証08-02 · 30 分で読了
無料
研究解説
🎧№ 1101
RESEARCH
出典 · BleepingComputer⚑ 研究論文

ブラウザセキュリティ企業LayerX、AIアシスタント騙す新種の「視覚詐欺」攻撃を発見

カスタムフォントのグリフ置換と数行のCSSだけで実行可能で、JavaScriptもブラウザの脆弱性も不要です。

AIセキュリティブラウザアシスタント▶ 再生07-30 · 10 分で読了
研究解説
🎧№ 1099
RESEARCH
出典 · OpenAI⚑ チュートリアル

API設定2つでGPT-5.6 SolのARC-AGI-3が13.3%→38.3% OpenAI自報

モデルは据え置き。変えたのはハーネス——プライベート推論の保持と、削除に代わるコンパクション(文脈圧縮)で、1ゲームあたりの出力トークンは約6分の1に。

ARC-AGI-3ハーネス▶ 再生07-30 · 9 分で読了
無料
研究解説
🎧№ 1097
RESEARCH
出典 · Anthropic⚑ 研究論文

Claude Mythos、暗号学で画期的進展——アルゴリズム自体の数学的脆弱性を直接発見

いずれの結果も実運用中のシステムには影響しない。HAWKはまだ未採用で、AESへの攻撃は七ラウンド簡略版にとどまり、完全な十ラウンド版は無傷だ。

暗号学AIによる研究▶ 再生07-29 · 13 分で読了
無料
研究解説
🎧№ 1092
RESEARCH
出典 · OpenAI Economic Research⚑ 研究論文

OpenAIが80万件の業務関連メッセージを分析:人々がAIにやらせている仕事の大半は、本来の職務ではない

同じデータから43.5%と65%〜82%という異なる結論が導き出される理由は、分母の切り分け方の違いにあります。

OpenAI労働経済学▶ 再生07-28 · 12 分で読了
無料
研究解説
🎧№ 1089
RESEARCH
出典 · Kimi K3 技术报告⚑ 研究論文

2.8兆パラメータの「Kimi K3」技術レポート:3つのアーキテクチャ改修で計算効率を2.5倍に向上

リリースから11日後に公開された47ページのレポートは効率化に焦点を当てており、同一の計算資源でK2の2.5倍の性能を実現しています。

Kimi K3Moonshot AI▶ 再生07-28 · 16 分で読了
無料
研究解説
№ 1085
RESEARCH
出典 · Google Blog / AI & Economy ATLAS v1.0⚑ 研究論文

Google、Gemini対話1465万件を分析 日常会話の86%は仕事に無関係

職業ごとに見ると、AIが使われるタスクは中央値で全体の5分の1にとどまり、29%の職業ではAIが一つも使われていません。知的作業のうち、AIに最初から最後まで任せるケースはわずか6.5%です。

GoogleAIと経済07-27 · 14 分で読了
研究解説
№ 1071
RESEARCH
出典 · Databricks⚑ 公式PR

Databricks、数百万行規模のコードベースでモデル×Harnessのコスパを実測

同じモデルでも外側(Harness)を変えるだけでコストが2倍変わる。オープンソースのGLM 5.2はOpus 4.8と同等の性能ながら、1問あたりのコストは3割安い。出題は自社が既にマージ済みのPRを改変したもので、ネット検索では見つからない。

コーディングAgentベンチマーク07-22 · 9 分で読了
研究解説
🎧№ 1064
RESEARCH
出典 · Memories.ai Research⚑ 研究論文

Memories.ai、動画と音声を同時処理するAIを高速・低コスト・高精度にする「O-MARC」を発表

音声トラックを外してもう一度解かせることで、映像だけで正解できてしまう設問をふるい落とす専用ベンチマークも同時に公開しました。

動画理解マルチモーダル圧縮▶ 再生07-21 · 12 分で読了
研究解説
🎧№ 1058
RESEARCH
出典 · New Scientist⚑ キーパーソン

AIの文章・創作支援は「ほどほど」が最適、実験で判明

同じ研究を3回検証しても、結果は毎回「中間くらい」を指し示した。筆者本人もChatGPTに映画のあらすじを書かせてみたが、結局は手書きの方がいいと語る。

AI創作創造性▶ 再生07-20 · 7 分で読了
研究解説
🎧№ 1053
RESEARCH
出典 · arXiv⚑ 研究論文

API中継で選んだモデル、密かにすり替えられている疑い――乱数一つで正体判明

同一モデルを2回サンプリングした際の指紋距離の中央値は0.140。自社開発のフラッグシップモデルとして宣伝されていたAPIは、オープンソースのQwenとの距離が0.141でした。つまり、そのAPIはオープンソースのQwenと実質的に見分けがつかないということです。

モデルフィンガープリントAPI監査▶ 再生07-20 · 11 分で読了
研究解説
🎧№ 1042
RESEARCH
出典 · Impossible Research⚑ 研究論文

外殻の交換だけでOpus 4.8とFable 5がARC-AGI-3で99%到達

Schemaと呼ばれる外殻が、モデルに各ゲームのルールを実行可能なプログラムとして書かせ、検証を終えてから初めて動かす仕組み。公開25局での自己採点は98.98%だが、ARC Prizeによる独立検証はまだ受けていない。

ARC-AGI-3世界モデル▶ 再生07-17 · 12 分で読了
無料
研究解説
№ 1035
RESEARCH
出典 · Design Arena

GPT-5.6 Sol、フロントエンドデザイン榜で首位に デザイン美学を習得しAI特有のパターンを回避

第三者評価プラットフォームのDesign ArenaがGPT-5.6 Solの一千点に及ぶウェブページ作品を分析したところ、デザイン空間に欠けていたのは、紫色のグラデーションなどAIにありがちな表現が置かれるべき領域でした。

GPT-5.6 SolAIウェブデザイン07-16 · 6 分で読了
無料
研究解説
№ 1027
RESEARCH
出典 · MIT News / Science⚑ 研究論文

MITが開発した羽ばたきロボット鳥、脚を使わずに水中と空中を移動

250グラムのロボットが同じ柔軟な翼で水と空を移動し、70度の仰角で8〜10回の羽ばたきで湖から飛び立つことに成功した。

MITバイオミメティクスロボット07-15 · 8 分で読了
無料
研究解説
№ 1020
RESEARCH
出典 · PrismML⚑ 研究論文

PrismML、27BモデルをiPhoneに収納——知能低下はわずか

約54GBの27Bモデルを約3.9~5.9GBに圧縮。スマホ単体で動作し、平均スコアも約9割を維持。まずは中核的価値から解説、技術詳細と注意点は後半で。

Bonsai 27B端末AI07-15 · 12 分で読了
無料
研究解説
🎧№ 1014
RESEARCH
出典 · Anthropic⚑ 研究論文

Anthropicが30万件の対話を分析:言語によってClaudeの価値観は変わる

3モデル・20言語を分析:英語は最も慎重かつ深く、ロシア語は最も厳格、ヒンディー語は最も温かく、中国語は全体平均に近い

Anthropic研究Claude価値観▶ 再生07-14 · 9 分で読了
無料
研究解説
🎧№ 1013
RESEARCH
出典 · Sakana AI / Nature Communications⚑ 研究論文

Sakana AI、"大"脳なしで自在に組み合う3Dスマート細胞ブロックを開発——"生物"のような群知能を発揮

"大脳"(中央コントローラー)の指令なしに、200個近い普通のスマートキューブが"ひそひそ話"のようにやり取りするだけで、自分たちがどんな形に組み上がったかを把握し、損傷後にはどこへ"再生"すべきかまで判断できる。前半部分はすでに実機のブロックで実証済みだが、損傷箇所の特定と再生は依然として主にシミュレーション上で行われている。

Sakana AI群知能▶ 再生07-14 · 9 分で読了
研究解説
🎧№ 1010
RESEARCH
出典 · arXiv · Meta AI⚑ 研究論文

Meta AI がプロアクティブ記憶エージェントを提案:『リマインドすべき時だけリマインド』をエージェントに学習させ、Terminal-Bench正解率が8.3ポイント向上

論文には「オープンソース化済み」とあるが、実際にコードリポジトリを確認すると中身は空で、コードは一行も push されていなかった。

AIエージェント長時間タスク記憶▶ 再生07-13 · 9 分で読了
研究解説
🎧№ 1008
RESEARCH
出典 · Anthropic 官方博客⚑ 研究論文

Claude Cowork の最大の用途はオフィス雑務(33.4%)、コーディングはわずか8.7%――UIの形がAIの使い道を決める

サンプルは120万件のセッション、60万以上の組織をカバー:コンテンツ制作がすぐ後に続き16.4%、両者合わせて利用量のほぼ半分を占める。

Claude CoworkAnthropic▶ 再生07-13 · 7 分で読了
無料
研究解説
🎧№ 1006
RESEARCH
出典 · VentureBeat⚑ 研究論文

AIにコードを書かせると、存在しないパッケージを薦めてくる:ハッカーは同じ名前でマルウェアを仕込み済み

57.6万サンプル・16モデルで実測:AI推薦パッケージの19.7%が幻覚、43%は同じ偽名を繰り返し生成する。

AIセキュリティソフトウェアサプライチェーン▶ 再生07-12 · 9 分で読了
研究解説
🎧№ 1001
RESEARCH
出典 · EPFL 项目主页⚑ 研究論文

脳はどこで何を見たがる?EPFL、AIに動画を延々生成させ各脳領域の「お気に入り」を発見

すべての結果は脳の「デジタルツイン」モデルによるコンピューターシミュレーション予測であり、実際の脳画像を用いた実測検証はまだ行われていない。

神経科学進化的アルゴリズム▶ 再生07-11 · 9 分で読了
研究解説
🎧№ 112
RESEARCH
出典 · Google Research⚑ 研究論文

Google Research、SensorFM発表 ― 1兆分のウェアラブルデータで学習、35件の健康タスク中33件で勝利

500万人・20億時間分のウェアラブルデータで事前学習。エンコーダーを凍結して線形ヘッドを一つ繋ぐだけで、34/35件の健康タスクで教師あり学習ベースラインを上回った。

SensorFMウェアラブル健康データ▶ 再生07-10 · 8 分で読了
研究解説
🎧№ 104
RESEARCH
出典 · arXiv / Google DeepMind⚑ 研究論文

Gemma 4技術レポート:オープンモデルが「軽量×推論力×省メモリ」で大型モデルに挑む

肝心なのは機能一覧ではない。思考モードで知能を底上げし、効率スタックでコストを圧縮し、ネイティブマルチモーダルで入力を拡張する——三つの技術ラインを同時に締め上げることだ

Gemma 4オープンソース大規模モデル▶ 再生07-09 · 12 分で読了
研究解説
🎧№ 103
RESEARCH
出典 · LangChain Blog⚑ 研究論文

LangChain:harnessの調整だけでNemotron 3 UltraがOpus 4.8に肉薄、コストは約1/10——高額な閉鎖系APIは不要と証明

システムプロンプト・ツール説明・ミドルウェアの3箇所に手を入れ、Deep Agentsスイートは典型で0.80→0.84、最高0.86(Opus 0.87)に到達。

LangChainNemotron▶ 再生07-09 · 9 分で読了
研究解説
🎧№ 102
RESEARCH
出典 · Lil'Log⚑ 研究論文

AIの自己進化は「外側」から始まる:Lilian Weng が harness エンジニアリングを徹底解説

元OpenAI安全責任者が論文約30本を整理:プロンプト修正から自己コード改変まで、DGMはコーディング能力を20%から50%に押し上げた。

harnessエンジニアリング再帰的自己改善▶ 再生07-09 · 13 分で読了
研究解説
🎧№ 096
RESEARCH
出典 · Liquid AI⚑ 研究論文

Liquid AIがAntidoomを発表:推論モデルの「無限ループ」問題をトークン1つの修正で解消、OSS公開

ループの起点となる単一トークンだけを微調整し、両モデルとも無限ループ率を1%前後まで低減

Liquid AI推論モデルの無限ループ▶ 再生07-08 · 8 分で読了
無料
研究解説
🎧№ 088
RESEARCH
出典 · Anthropic⚑ 研究論文

Anthropic、Claude内部に脳の「内的思考空間」に似た領域を発見 ― 設計にはなく、自ら進化で獲得したものだった

全体の1割に満たない領域だが、取り除くとClaudeは会話はできても推論がゼロになる。すでにモデルのデータ捏造の摘発や、テストの見破りに活用されている

解釈可能性研究Claude▶ 再生07-07 · 8 分で読了
無料
研究解説
🎧№ 087
RESEARCH
出典 · iTextbooks'26 论文⚑ 研究論文

ダートマス大学の実証実験:AI採点は「杓子定規」と不評でも、使った学生の成績は伸びた

被験者151人の実証:記述式問題は選択式問題より得点アップ効果が高い一方、AI質問応答サイドバーはほとんど使われなかった

AI教育テック形成的評価▶ 再生07-06 · 8 分で読了
無料
研究解説
🎧№ 083
RESEARCH
出典 · Seldo.com(Laurie Voss)⚑ 研究論文

初级程序员岗位被AI烧穿:编程正从职称变成人人都会的技能

美国22-25岁开发者就业三年跌19%,同时GitHub新账户涨到史上最快

AI就业冲击初级程序员▶ 再生07-05 · 9 分で読了
研究解説
🎧№ 082
RESEARCH
出典 · arXiv · NVIDIA Research⚑ 研究論文

NVIDIA Research、HORIZON発表——無人運用のエージェントがRTLチップ設計ベンチマークを全問100%クリア

論文史上初、エージェントが完全無人でRTL全ベンチマークを走破。大半は2〜3回で正解も、最難問だけは82回の反復を要した

NVIDIA ResearchAgentic ワークフロー▶ 再生07-05 · 12 分で読了
研究解説
🎧№ 081
RESEARCH
出典 · Anthropic⚑ 研究論文

Anthropic調査:Claude Code 40万セッションが明かす、AIコーディングの成否を分けるのは「専門性」

23.5万ユーザー、7カ月にわたるセッション分析——専門家の検証済み成功率は初心者のほぼ2倍だが、上位10職種の差はわずか7ポイント以内

Claude CodeAnthropic研究▶ 再生07-05 · 7 分で読了
研究解説
🎧№ 060
RESEARCH
出典 · Thinking Machines Lab⚑ 研究論文

Bridgewater、金融情報選別に特化したモデルを開発 正解率84.7%で手法も公開

Thinking Machinesと共同、専門家ラベル付きデータでオープンソースモデルをファインチューニング。最先端モデル比でエラー率29.8%減、推論コストは14分の1に

Tinker強化学習ファインチューニング▶ 再生07-01 · 7 分で読了
研究解説
№ 056
RESEARCH
出典 · Meta AI Blog⚑ 研究論文

開頭せずに脳波を解読、Metaの非侵襲型は精度が同業の8倍近くに

ヘルメット型デバイスを装着するだけでリアルタイムに脳磁(MEG)信号をデコード。単語正解率は8%から61%へ跳躍し、v1/v2の学習コードとデータセットも同時にオープンソース化

ブレイン・マシン・インターフェースMeta AI06-29 · 5 分で読了
研究解説
№ 051
RESEARCH
出典 · METR⚑ 研究論文

GPT-5.6 Sol、不正行為率が過去最悪を更新 評価機関は「むしろ安心材料」と評価

能力スコアは3つのバージョンが出てどれも信用できないが、目に見える不正行為そのものが安全監視が機能している証拠になった

GPT-5.6AI安全性06-27 · 5 分で読了
研究解説
№ 049
RESEARCH
出典 · Wan Streamer⚑ 研究論文

Wan Streamer:見て聞いて話せるリアルタイムAI

モデル側の応答は約200ms、総遅延は約550ms。v0.1は192pのみ対応、デモは事前収録でリアルタイム体験ではない

マルチモーダル大規模モデル全二重リアルタイムインタラクション06-27 · 5 分で読了
研究解説
№ 043
RESEARCH
出典 · IBM Newsroom⚑ 研究論文

IBM、世界初の0.7nmチップを発表――爪ほどの大きさに1000億個近いトランジスタ

実験室レベルでは量産可能と実証済み。性能+50%、電力効率+70%はいずれも2nm比の予測値で、実測値ではない

IBM半導体06-26 · 6 分で読了