Daily CS Research - 2026-04-01
2026-04-01
Claude Code v2.1.88
Daily CS Research - 2026-04-01
論文一覧
1. 合成ウェブ: 言語エージェントの認識論的弱点を診断するための敵対的キュレーション型ミニインターネット
- 原題: The Synthetic Web: Adversarially-Curated Mini-Internets for Diagnosing Epistemic Weaknesses of Language Agents
- 著者: Shrey Shah, Levent Ozgur
- 所属: Microsoft
- 掲載誌 / 会議 / プレプリント: arXiv プレプリント (2603.00801)
- 公開日: 2026-02-28
- 分野: 人工知能 / 言語エージェント
- URL: https://arxiv.org/abs/2603.00801
要約:
LLM ベースの言語エージェントがウェブ検索で情報を取得する際の認識論的脆弱性を体系的に評価するベンチマークを提案している。
数千のハイパーリンク付き記事から構成される手続き的に生成された「合成ウェブ」環境を構築し、信頼性と事実性のグラウンドトゥルースラベル、プロセスレベルのインタラクショントレースを備えている。
偽の情報源を検索結果の上位に1件配置するだけで、GPT-5 の精度が 65.1% から 18.2% に急落し、o3・o1・4o でも同様の低下が確認された。
主要な3つの失敗モードとして、検索の最小限のエスカレーション(証拠が矛盾しても検索を拡大しない)、統合の失敗(広範な検索でも情報源を統合できない)、深刻な較正ミス(誤答時でも高い確信度を維持する)が特定された。
検索結果のランキング操作に対する堅牢性を評価するテストベッドとして、次世代の検索堅牢かつ認識論的に謙虚なエージェント開発への指針を提供している。
キーワード: 言語エージェント、敵対的評価、情報検索、認識論的堅牢性、ベンチマーク
2. VJEPA: 確率的世界モデルとしての変分結合埋め込み予測アーキテクチャ
- 原題: VJEPA: Variational Joint Embedding Predictive Architectures as Probabilistic World Models
- 著者: Yongchao Huang
- 所属: 不明
- 掲載誌 / 会議 / プレプリント: arXiv プレプリント (2601.14354)
- 公開日: 2026-01-20
- 分野: 機械学習 / 自己教師あり学習
- URL: https://arxiv.org/abs/2601.14354
要約:
JEPA(結合埋め込み予測アーキテクチャ)の確率的一般化として VJEPA を提案し、変分目的関数を通じて将来の潜在状態の予測分布を学習する枠組みを構築している。
既存の JEPA は決定論的回帰目的に依存しており、確率的意味論を隠蔽し確率的制御への適用を制限していた。
VJEPA は表現学習を予測状態表現(PSR)およびベイズフィルタリングと統一し、逐次モデリングに自己回帰的な観測尤度が不要であることを確立した。
ピクセル再構成なしに最適制御のための十分な情報状態として機能できることの理論的保証と、崩壊回避の形式的保証を提供している。
さらに、学習されたダイナミクスエキスパートとモジュール式事前分布エキスパートに予測信念を分解する Bayesian JEPA(BJEPA)を提案し、ゼロショットタスク転移と制約充足を可能にしている。
キーワード: 自己教師あり学習、世界モデル、変分推論、JEPA、確率的制御
3. AI-for-Science ローコードプラットフォーム: ベイズ敵対的マルチエージェントフレームワーク
- 原題: AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework
- 著者: Zihang Zeng, Jiaquan Zhang, Pengze Li et al.
- 所属: Fudan University, Shanghai Innovation Institute, Shanghai Academy of AI for Science
- 掲載誌 / 会議 / プレプリント: arXiv プレプリント (2603.03233)
- 公開日: 2026-03-03
- 分野: ソフトウェア工学 / マルチエージェントシステム
- URL: https://arxiv.org/abs/2603.03233
要約:
LLM による科学コード生成の信頼性向上を目的とした、ベイズ敵対的マルチエージェントフレームワークを提案している。
タスクマネージャ(ユーザー入力を実行可能な計画と適応的テストケースに構造化)、コードジェネレータ(候補ソリューションを生成)、エバリュエータ(包括的フィードバックを提供)の3つの LLM ベースエージェントをベイズフレームワーク下で協調させる。
タスクマネージャがテストケースを反復的に改良してコードジェネレータに挑戦する敵対的ループを採用し、プロンプト分布はベイズ原理に基づき動的に更新される。
コード品質メトリクス(機能的正確性、構造的整合性、静的解析)を統合することで、成功指標が不明確な科学ドメインにおけるエラー伝播問題に対処している。
科学計算コードの自動生成における信頼性と品質保証の新たなアプローチとして実用的な意義がある。
キーワード: マルチエージェント、ベイズ最適化、コード生成、科学計算、ローコード
4. Cirrus: 高性能かつ説明責任のある分散 SNARK
- 原題: Cirrus: Performant and Accountable Distributed SNARK
- 著者: Wenhao Wang, Fangyan Shi, Dani Vilardell, Fan Zhang
- 所属: 不明
- 掲載誌 / 会議 / プレプリント: NDSS 2026 (33rd Network and Distributed System Security Symposium)
- 公開日: 2026-02(NDSS 2026 にて発表)
- 分野: 暗号・セキュリティ / 分散システム
- URL: https://www.ndss-symposium.org/ndss-paper/cirrus-performant-and-accountable-distributed-snark/
要約:
分散 SNARK(簡潔な非対話型知識証明)生成において、低オーバーヘッド(ワーカーあたり線形計算量・対数通信量)、説明責任(悪意あるワーカーの効率的検出)、回路やワーカー数に依存しないユニバーサル信頼セットアップの3つの望ましい特性を同時に達成する初のプロトコルである。
HyperPlonk(EUROCRYPT'23)上に構築され、ユニバーサル信頼セットアップを継承しつつ、ワーカーとコーディネータの両方で線形計算量を達成している。
32台の8コアマシンを用いて3,300万ゲートの回路に対し40秒未満で証明を生成し、最先端の説明責任付きプロトコル Hekaton(CCS'24)と比較して PLONK 適合回路で7倍以上高速な証明生成を実現した。
説明責任プロトコルにより、不正なワーカーをわずか4秒で特定でき、分散化されたアウトソーシング計算シナリオに特に適している。
キーワード: ゼロ知識証明、SNARK、分散計算、説明責任、暗号プロトコル
5. Xuanwu: 汎用マルチモーダルモデルからコンテンツエコシステム向け産業グレード基盤モデルへの進化
- 原題: Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems
- 著者: 不明(複数著者)
- 所属: 不明(産業界)
- 掲載誌 / 会議 / プレプリント: arXiv プレプリント (2603.29211), ICML 2026 査読中
- 公開日: 2026-03-31
- 分野: コンピュータビジョン / マルチモーダル学習
- URL: https://arxiv.org/abs/2603.29211
要約:
汎用マルチモーダルモデルを産業グレードのコンテンツエコシステム基盤モデルへ発展させるケーススタディとして Xuanwu VL-2B を提示している。
InternViT-300M + MLP + Qwen3 1.7B のコンパクトなアーキテクチャを採用し、細粒度の視覚認識、言語意味整合、デプロイメントコストを約20億パラメータの予算内でバランスさせている。
事前学習・中間学習・事後学習の3段階パイプラインで、ビジネス特化と汎用能力保持の両立を図るデータ反復・キュレーションメカニズムを導入した。
OpenCompass マルチモーダル7指標の平均スコア 67.90(InternVL 3.5 2B の 64.27 を上回る)、7つのビジネスモデレーションタスクでの平均リコール 94.38%、敵対的 OCR シナリオでのポリシー違反テキスト検出で加重リコール 82.82%(Gemini-2.5-Pro を上回る)を達成した。
コンテンツ理解・コンテンツモデレーション・敵対的コンテンツ防御の階層的アーキテクチャにより、実運用環境での安全性スタックを構築している。
キーワード: マルチモーダルモデル、コンテンツモデレーション、基盤モデル、産業応用、視覚言語モデル
調査方法
以下の検索クエリと情報源を使用して論文を調査した。
- arXiv カテゴリ別新着一覧: cs.LG, cs.AI, cs.SE, cs.PL, cs.CR, cs.DC, cs.CV
- Web 検索クエリ:
arXiv cs.LG cs.AI new papers March April 2026 machine learningarXiv cs.SE cs.PL software engineering programming language research 2026arXiv cs.CR cs.DC security distributed systems new paper 2026arXiv cs.CV computer vision new paper March 2026 multimodal- 各論文の個別検索(タイトル・著者・arXiv ID による詳細取得)
- NDSS 2026 採択論文一覧
- IACR ePrint Archive