arXiv に関する報道
関連記事 200 件
検証可能な人類の知識のタイムカプセル: 41年間の危機!単一の無料ローカル モデル内
Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model
AI インサイトかつて IBM Watson が Jeopardy! を支配するにはクラスターと数千億のドキュメントが必要でしたが、現在では 41 年間で初めて、単一の 9GB オープンソース モデルが 529,939 個の手がかりで完全に実行されるようになりました。これは、文化的知識のテスト可能なスナップショットが、大規模な閉鎖システムからポータブルでほぼ無料のローカル機能へ移行していることを示しています。重要度 74/100すべての説明が求められるわけではない: 人間中心の XAI のための情報探索心理学
Not All Explanations Are Sought: Information-Seeking Psychology for Human-Centered XAI
AI インサイトこのポジションペーパーでは、情報探索心理学を人間中心の説明可能な AI (HCXAI) に導入することを提案しています。より詳細な説明の生成に焦点を当てた以前の技術的パスと比較して、この新しい次元は、ユーザーが説明を理解するかどうかを評価する認知メカニズムです。この論文では、ユーザーはツール、快楽、認知という 3 つの期待されるユーティリティに基づいて説明を見るかどうかを決定し、この決定は制御錯覚や自動化バイアスを含む 6 種類の認知バイアスの影響を受けると指摘しています。これは、HCXAI システムの設計を、一方的な出力から、ユーザーの説明回避や過剰な要求行動に積極的に介入するように移行する必要があることを意味します。重要度 50/100関係の検索、誤謬の検出: 政治議論分析への RAG アプローチ
Retrieving Relations, Detecting Fallacies: A RAG Approach to Political Debate Analysis
LLM 拡張因果発見: エッジの存在と方向の確率的融合
LLM-Augmented Causal Discovery: Probabilistic Fusion of Edge Existence and Orientation
仮説、評価、洗練: 未知の空間係数場を使用した偏微分方程式発見のための科学エージェント
Hypothesize, Evaluate, Refine: A Scientific Agent for PDE Discovery with Unknown Spatial Coefficient Fields
フライング ブロック パズルを解くためのクラスベースのヒューリスティック選択
Class-Based Heuristic Selection for Solving the Flying Block Puzzle
AI インサイトフライング ブロック問題などの NP 完全空間計画問題に対しては、クラスベースのヒューリスティック A* アルゴリズム (CBHA*) が提案されています。空間構造制約を利用できずパフォーマンスの低下を招いていた以前の一般的なヒューリスティックと比較して、新しいアルゴリズムは一般的な移動制約を統合して、空席が少ない場合の最小移動コストを把握し、マルチエージェント経路計画などの制限された空間領域に新しいソリューションを提供します。重要度 65/100関連エンティティarXiv茶園におけるポストエレクトロテルメス・ミリタリスの検出と重症度評価におけるIoTとディープラーニングの有効性
Effectiveness of IoT and Deep Learning for Detection and Severity Assessment of Postelectrotermes militaris in Tea Plantations
AI インサイトこの研究では、茶園でのシロアリ検出のために IoT 音響モニタリングと深層学習を組み合わせ、2,000 個の 10 秒音声サンプル (半分は健全/損傷) を使用してモデルをトレーニングする非侵襲的な方法を提案しています。これまでの手動検査に依存していたものと比較して、この方法は初めて音響と地理座標に基づいた自動深刻度評価を実現し、農業害虫モニタリングのための低コストのエンドツーエンドのソリューションを提供します。重要度 60/100知識ベース システムにおける一般化されたレベルベースの評価のためのコンテキスト ローカリゼーション
Context Localization for Generalized Level-Based Evaluation in Knowledge-Based Systems
AI インサイトarXiv は、知識ベース システムにおける一般化された水平評価のためのコンテキスト ローカリゼーション フレームワークを提案する新しい研究を発表しました。以前の静的ルール検証と比較して、このフレームワークは、許容される知識コンテキストの条件付き集計テストを通じて構造化スコアを評価し、コンテキスト フィルタリングがローカリゼーションと同等になるための必要十分な条件を提供します。これにより、ルールベースの AI システムに証明可能な評価の一貫性が提供されます。重要度 40/100関連エンティティarXivCareGraph: 証拠に基づいたパーソナライズされた長期的な健康インテリジェンスのための監査可能なハイブリッド AI フレームワーク
CareGraph: An Auditable Hybrid AI Framework for Evidence-Grounded Personalized Longitudinal Health Intelligence
トークンのコストを考える: より多くの構造が価格に見合う価値がある場合
Thinking Costs Tokens: When More Structure is Worth the Price
AI インサイトarXiv 論文では、財務推論タスクにおける GPT-5.4 mini のトークン バジェットしきい値をテストしました。デフォルトの推論構造は常に有益であるというこれまでの静的な認識とは対照的に、調査によると、計画と検証のオーバーヘッドがパフォーマンスに悪影響を与える明確な予算しきい値が存在することが示されています。これは、複雑なエージェント アーキテクチャの展開が推論コストの境界によって制限され、無条件に効果的ではないことを意味します。重要度 68/100WM-R1: 強化学習を使用して世界モデルを推論し活用するための GUI エージェントのトレーニング
WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning
AI インサイトこの論文では、モバイル GUI エージェントをトレーニングするために実際の環境の代わりにワールド モデルを使用する最初の RL フレームワークである WM-R1 を提案しています。大量の実環境インタラクションに依存していた以前の GUI RL と比較して、このメソッドは状態転送ソースをワールド モデルに完全に切り替え、アクションの結果を予測するための思考プロセスを埋め込みます。これは、GUI エージェントのトレーニングに伴う高いリソース消費と不安定性が軽減され、モバイル端末の自動展開のための環境インタラクション コストが削減されることが期待されることを意味します。重要度 75/100SETU: 多言語でペルソナを意識したコミュニケーション コーチングのためのエージェント エコシステム
SETU: An Agentic Ecosystem for Multilingual, Persona-Aware Communication Coaching
Nemotron 3.5 コンテンツ セーフティ モデレータ: コンパクトなマルチモーダル、多言語、推論対応のコンテンツ セーフティ モデレータ
Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning Enabled Content Safety Moderator
生成型 AI はコースベースの学部研究体験 (CURE) の知的到達範囲を拡大します
Generative AI Expands the Intellectual Reach of Course Based Undergraduate Research Experiences (CUREs)
AI インサイトこの研究は、バイオインフォマティクス CURE の 3 学期にわたる長期的な定性データに基づいており、GenAI が個別化された動的サポートを通じて学生の研究経験の知的範囲を拡大したことが判明しました。教師の即応的なサポートに依存していた以前の CURE と比較して、この実証的実証は大学院研究における GenAI の具体的な増加価値を示していますが、サンプルは単一のコースに限定されており、一般化可能性を検証する必要があります。重要度 65/100エージェントが天使であれば、ガバナンスは必要ありません: 信頼できるツール境界での帯域外ポリシーの適用
If Agents Were Angels, No Governance Would Be Necessary: Out-of-Band Policy Enforcement at a Trusted Tool Boundary
AI インサイトこの調査では、エージェントの権限ガバナンスを脆弱なプロンプト ワード制約から信頼できるツール境界層に移行し、バックグラウンド コールの前にクエリを絞り込み、応答フィールドをフィルタリングする帯域外ポリシー強制 (OBPE) を提案しています。エージェントによる独立した判断や迅速なインジェクション防御に依存していた以前のバージョンと比較して、OBPE はツール レベルでポリシーを強制し、エージェント乱用リスクの制御点を変更します。重要度 80/100協調的なプロセスのオブジェクト中心の予測監視のためのフレームワーク
A Framework for Object-Centric Predictive Monitoring of Collaborative Processes
AI インサイトこの論文では、協調プロセスの予測モニタリングを単一ケースの観点からオブジェクト中心の表現に移行し、形式的なマッピングを通じて拡張イベント ログを OCED と一貫性のあるオブジェクト中心の構造に変換することを提案します。イベント ログを拡張するだけで単一ケースの観点を保持する既存の方法と比較して、このフレームワークは、参加者やメッセージなどの複数エンティティの関係を初めて明示的にモデル化するため、組織を越えたコラボレーションの構造情報が暗黙的ではなくなり、複数ケースの観点から予測モデリングの基礎を提供します。重要度 64/100全員のためのエージェント: 分散型キュレーション コミュニティでエージェント AI 機能を構築するためのワークショップ フレームワーク
Agents for Everyone: A Workshop Framework for Building Agentic AI Capabilities in a Distributed Curation Community
AI インサイトこの記事では、JupyterHub クラウド環境と共通インターフェイスとしての Claude Code に基づいた、Gene Ontology Alliance 向けのエージェント AI トレーニング ワークショップ フレームワークを提案します。これにより、キュレーターはブラウザ端末を介してエージェントと対話できます。エージェント AI の取得とトレーニングにおけるこれまでの困難と比較して、この方法は再現可能で閾値の低い展開パスを提供し、生物学的データベースのインテリジェントなキュレーションを加速する可能性があります。重要度 62/100PCFBench: 製品の二酸化炭素排出量推定の診断ベンチマーク
PCFBench: A Diagnostic Benchmark for Product Carbon Footprint Estimation
解釈可能な生成制御を使用したギブズ サンプリングによる MLLM の知覚事前分布の調査
Probing Perceptual Priors of MLLMs via Gibbs Sampling with Interpretable Generative Controls
なぜチェックしなかったのか?サポートされていない最終クレームと 2 つのツールを備えた言語モデルでのその修復
Why Didn't It Check? Unsupported Final Claims and Their Repair in Two Tool-Equipped Language Models
信条: エージェントティック ワークフローのための再利用可能な宣言プリミティブ
Credo: Reusable Declarative Primitives for Agentic Workflows
ReToolSQL: 堅牢な Text-to-SQL のためのエージェント強化学習
ReToolSQL: Agentic Reinforcement Learning for Robust Text-to-SQL
AI インサイトReToolSQL は 2 段階のトレーニング フレームワークを提案しています。このフレームワークでは、最初に教師ありホット スタートに拒否サンプリング推論軌跡を使用し、次に複数ラウンドのツール使用軌跡に対してエージェント強化微調整 (RFT) を実行します。 SQL 生成を単一ラウンドのタスクとして扱うこれまでのほとんどの方法と比較して、複数ラウンドの反復的なエラー修正を通じて堅牢性が向上し、小規模なモデルでも大規模なシステムと同等またはそれを上回ることが可能になります。これは、実行フィードバック強化学習がシングルラウンド生成からマルチラウンド エージェント パラダイムに進化していることを意味します。重要度 65/100CEDAR: 言語ガイドによる身体的アクションのための検証可能なインターフェースとしてのオートマトン
CEDAR: Automata as Verifiable Interfaces for Language-Guided Embodied Action
CURA: コンピュータ使用エージェント向けの認定ランタイム アラーム
CURA: Certified Runtime Alarms for Computer-Use Agents
証拠に基づく高次集合論証フレームワーク
Evidential-Based Higher-Order Set Argumentation Framework
RealSWE: 現実的なユーザー要求に基づくコーディング エージェントの構成評価
RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
AI インサイトRealSWE は、実際のユーザー リクエストと SWE ベンチ ベンチマーク タスクを比較したところ、実際のプロンプトの 88% には、問題のステートメントまたは最小限のコンテキストのみが含まれていたのに対し、ベースラインではわずか 7% であったことがわかりました。実際のプロンプトの 87% は口語的なものでしたが、ベースラインの正式なステートメントでは 94% でした。これは、エンコード エージェントの評価に大幅な分布の変化があり、既存のベンチマークが実際の短いリクエストを処理するモデルの能力を過大評価していることを意味します。重要度 76/100KLOD: 非ターゲット分布保存による局所性保存知識編集
KLOD: Locality-Preserving Knowledge Editing via Non-Target Distribution Preservation
大規模ベンチマークにおける都市間POI推奨の実証的評価
An Empirical Evaluation of Cross-City POI Recommendation on a Large-Scale Benchmark
AI インサイトこの研究では、Trip World の大規模ベンチマークで都市をまたぐ POI の推奨を再調査し、代表的な手法がユーザーの好みの移行、精度と効率のトレードオフの低下、その他のボトルネックではなく、目的地の事前設定に依存していることがわかりました。これまでの小規模なベンチマークの結論と比較すると、これはモデルの利点を直接推定することができず、最も単純なベースラインが強力に機能することを意味し、都市間の推奨は地球規模で地域の重複が少ないアルゴリズム設計に移行する必要があることを示唆しています。重要度 65/100不確実性から臨床リスクまで: 対話型医療診断のための重症度を意識したコンフォーマルプランニング
From Uncertainty to Clinical Risk: Severity-Aware Conformal Planning for Interactive Medical Diagnosis
AI インサイトこの研究では、インタラクティブな医療診断をリスクに敏感な逐次的意思決定問題としてモデル化し、臨床診断の見逃しと分布外の校正のリスクを初めて統一計画フレームワークに組み込んでいます。予測の不確実性やラベルの曖昧さのみを使用した以前の手法と比較して、新たに重症度を意識した停止と質問の意思決定メカニズムが追加されており、AI 診断システムが「精度の追求」から「臨床リスクの制御」に移行したことを意味します。重要度 74/100SpikeOPD: 自己回帰スパイク言語モデルの安定したオンポリシー蒸留
SpikeOPD: Stable On-Policy Distillation for Autoregressive Spiking Language Models
Core-MoE: 継続的なマルチモーダル命令チューニングのためのコンパクトで再利用可能な MoE
CoRe-MoE: Compact Reusable MoE for Continual Multimodal Instruction Tuning
参照、仮説、検証: 統治 PDE を発見するためのマルチモーダル エージェント フレームワーク
See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs
HyQuant: LLM アテンションのためのハイブリッド精度量子化
HyQuant: Hybrid-Precision Quantization for LLM Attention
Agentic AI システムのリソース制約とパフォーマンス
Resource Constraints and Performance in Agentic AI Systems
強化学習のためのルーブリックからコードへの単位の割り当て
Rubric-to-Code Credit Assignment for Reinforcement Learning
AI インサイトRCCA フレームワークは、インタラクティブな Web ページ生成における GRPO のシーケンス レベルの報酬の一様な分布によって引き起こされる弱いクレジット割り当ての問題を目的としており、ルーブリック レベルの関数フィードバックをコード領域のローカル最適化信号に変換します。これは、強化学習信号が粗粒シーケンス レベルから局所レベルに洗練されることを意味し、これにより、マルチデマンド シナリオでのトレーニング効率が直接的に向上します。以前の GRPO の統一された利点の割り当てと比較して、これは機能ルーブリックを特定のコード スニペットにマッピングする最初の明示的なメカニズムです。重要度 75/100ゲーム理論のレンズを通した AI の調整: 調査
AI Alignment through a Game-theoretic Lens: A Survey
AI インサイトこのレビューでは、ゲーム理論の観点から AI の調整を系統的にレビューし、嗜好の多様性、調整の優先順位、時間のダイナミクスという 3 つの課題に焦点を当てています。有用性や無害性などの静的な指標に焦点を当てた以前の内容と比較して、今回はコンテキスト依存性および自動詞的な好みを扱うためのフレームワークが提供されます。これは、アライメント研究が単一エージェントの最適化からマルチエージェント相互作用モデリングに移行していることを示しています。重要度 55/100文書から推論へ: 財務数値推論のための検証済み合成データ パイプラインとセマンティックを意識した微調整
From Documents to Reasoning: A Validated Synthetic Data Pipeline and Semantic-Aware Fine-Tuning for Financial Numerical Reasoning
AI インサイトこの論文では、財務 QA のための合成データ パイプラインとセマンティックを意識した微調整を提案し、EM などの標準指標は単位や形式の違いを無視しており、評価を誤解しやすい可能性があると指摘しています。前回はモデル推論機能に焦点を当てていましたが、今回は財務 QA パフォーマンス評価の信頼性を高めるために評価指標も最適化に含まれています。重要度 65/100CASTANET: 交通事故の影響を利用した因果関係を認識した時空間敵対的ネットワーク
CASTANET: Causality-Aware Spatio-Temporal Adversarial Network Using Traffic Incident Effects
クロスセッション分解攻撃: リスクの拡大と意図に沿った取得防御
Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense
AI インサイトこの研究は、クロスセッション分解攻撃を複合セキュリティ リスクとして形式化した最初の研究であり、リスク移行限界を証明します。つまり、合法的なサブクエリに対するモデルの超過損失が、展開時の複合リスクと参照リスクの間のギャップを制御します。単一セッションのジェイルブレイクに焦点を当てた前回の内容と比較して、今回はスケールの法則の裏側を明らかにします。つまり、より広い Transformer により、合成実験で予約されたサブクエリの損失が少なくなり、分解攻撃がより巧妙になる可能性があります。重要度 68/100$\textit{What If}$ の錯覚: LLM における反事実推論の内訳の評価
The Illusion of $\textit{What If}$: Evaluating the Breakdown of Counterfactual Reasoning in LLMs
AI インサイトarXiv の新しい研究では、初のオープンドメインの長距離反事実因果推論ベンチマークである WhatIfBench が提案されており、これには 220 の STEM、HSS、混合質問が含まれています。また、自然言語の説明を意味因果関係グラフに変換して自動評価する PRISM が装備されています。限定された変数と単一の標準的な回答による以前のベンチマークと比較して、今回はオープンドメインおよびオープン形式の因果プロセス評価に変わり、反事実推論評価の盲点を埋めます。重要度 62/100教師の指導が誤解を招く場合: 報酬に合わせたポリシーに沿った抽出
When Teacher Guidance Misleads: Reward-Aligned On-Policy Distillation
AI インサイト研究によると、OPD での生徒向けのプレフィックス生成に関する教師モデルのガイダンスが、結果の報酬から逸脱し、それによって最適化の誤解を招く可能性があることが判明しました。教師の蒸留信号が信頼できるという以前のデフォルトと比較して、今回はリスクが明確に調整され、一貫した報酬を伴う代替目標が提案され、蒸留トレーニングの安定性に対する認識が変わりました。重要度 65/100SABRE: 敵対的ブランチプローブによる LLM 推論の安定性を意識した早期終了
SABER: Stability-Aware Early Exit for LLM Reasoning via Adversarial Branch Probing
AERA: 効率的なテスト時間推論のための適応証拠残余割り当て
AERA: Adaptive Evidence Residual Allocation for Efficient Test-Time Reasoning
openJiuwen: 長期的なコーディング エージェント向けの静的ハーネスを超えて
openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents
AI インサイトopenJiuwen は、長期視点のコーディング エージェントのためのオープン フレームワークを提案します。中心となるのは、構造的な構成可能性と実行時の適応性という 2 つの主要な課題を解決することです。以前の静的オーケストレーションと比較して、新しいフレームワークでは、エージェント システムがタスクの証拠に基づいて決定を動的に調整できます。重要度 65/100パラメトリック マルチモーダル ユーザー メモリ: キャプションでは伝えられないものを保存
Parametric Multimodal User Memory: Storing What Captions Cannot Carry
AI インサイトこの論文では、テキスト字幕に依存するのではなく、知覚記憶 (音声、顔、疲労) をモデルに直接エンコードする、パラメーター化されたマルチモーダル ユーザー記憶を提案します。実験によると、字幕ベースの再識別子の再現率は専用エンコーダの再現率のわずか 0.11 です。これは、従来の RAG スタイルのテキスト メモリと比較して、ユーザーの記憶が「説明可能な」知覚次元から「言葉では言い表せない」知覚次元に拡張されることを意味します。重要度 72/100関連エンティティarXivGurukul AI: インドの教育システム向けのインタラクティブな AI 主導の教育プラットフォーム
Gurukul AI: An Interactive AI-Driven Educational Platform for Indian Education System
AI インサイトGurukul AI は、9 年生から 12 年生向けの NCERT 教科書に基づく 18,720 の質問と回答のペアのデータセットをリリースし、インドのカリキュラムに沿った AI 教育データのギャップを埋めます。西洋のデータでトレーニングされた以前のモデルと比較して、このデータセットはインドの標準化されたアウトラインを初めて体系的にカバーしていますが、それでも完全なプラットフォームではなく静的なデータセットです。重要度 65/100STAGEET: ケーススタディとしてアラビア語を使用した文法エラー修正のための段階的な型付き編集タグ付け
STAGEET: Stage-wise Typed Edit Tagging for Grammatical Error Correction with Arabic as a Case Study
GenAI の仮想患者対話ログから教師が解釈可能なプロセス証拠まで: 高等教育における学習分析の研究
From GenAI Virtual Patient Dialogue Logs to Teacher-Interpretable Process Evidence: A Learning Analytics Study in Higher Education
AI インサイトこの研究では、1,030 人の GenAI 仮想患者の会話を分析し、その完全な記録を、コーディングを通じて教師が解釈できる臨床推論プロセスの証拠に変換しました。これにより、最終スコアや生のログに依存していた以前の評価方法と比較して、教師は患者のリードをフォローアップしたか、不確実性をチェックしたかなど、学習者の行動を追跡できるようになります。重要度 72/100もう一度見てみる: プレッシャー下でのマルチモーダル モデルの推論チェーンにおけるお調子者の測定
Looking Again: Measuring Sycophancy in the Reasoning Chains of Multimodal Models Under Pressure
MA-RAG: 縦断的パーキンソン病評価のクエリ駆動要約のためのマルチエージェント検索拡張生成
MA-RAG: Multi-Agent Retrieval-Augmented Generation for Query-Driven Summarization of Longitudinal Parkinson's Disease Assessments
AI インサイトMA-RAG は、パーキンソン病の縦断的評価をドメイン固有のタスクに分解し、構造化された事実の抽出と検証の段階を通じて時間の一貫した要約を生成する、マルチエージェント RAG フレームワークを提案します。臨床的根拠のない一般的な LLM と比較して、この方法は、複数のエージェントの協力を初めて体系的に縦断的医療評価に導入し、事実の正確さと時間の一貫性を向上させます。重要度 62/100大規模な言語モデルはレビュー内容を精査していますか?スコア調整、エラー検出、および作成者のアイデンティティ効果のマルチモーダル監査
Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects
AI インサイトこの研究では、ICLR 2026 の提出審査において 2 つのマルチモーダル LLM のパフォーマンスを体系的にテストし、これらは著者名や図の情報に敏感であり、エラー検出機能が限られていることがわかりました。 LLM によって生成されたレビュー内容のみを評価していた過去と比較して、今回はアイデンティティバイアスと誤認の観点から LLM レビューの具体的な限界が初めて明らかになりました。重要度 82/100ドメイン固有の大規模言語モデルによる BIM の設計欠陥のインテリジェントな特定と修復
Intelligent Identification and Repair of Design Defects in BIM via Domain-Specific Large Language Models
汎用化されたスタイル認識型全二重フレームワークによるプロアクティブな音声ターンの有効化
Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework
AI インサイトこのペーパーでは、軽量のアクティブ ボイス ステアリング コントローラ LPS-TC を含む、一般的なスタイルを意識した全二重フレームワークを提案します。これは、全二重機能をサポートするために半二重モデルにプラグイン可能に統合できます。以前の受動的応答または単純な中断と比較して、このフレームワークは、きめの細かいアクション空間を通じて能動的および受動的方向転換動作をカバーし、応答の品質を犠牲にすることなく方向転換のタイミングを改善し、対話システムがターンベースからリアルタイムのアクティブなインタラクションに進化するための新しい道を提供します。重要度 72/100関連エンティティarXiv一時停止: 長編の文化ストーリーを適応させるための編集可能な戦略アーティファクト
PAUSE: Editable Strategy Artifacts for Long-Form Cultural Story Adaptation
MLLM はリソースの少ないクメール語文書を本当に理解しているのでしょうか?クメール文書 VQA に関するパイロット研究
Do MLLMs Really Understand Low-Resource Khmer Documents? A Pilot Study on Khmer Document VQA
Terminal-Bench-LILT: 言語、地域、文化に基づいた多言語エージェント コーディング ベンチマーク
Terminal-Bench-LILT: Multilingual Agentic Coding Benchmark Grounded in Language, Region, and Culture
AI インサイトTerminal-Bench-LILT がリリースされました。これには 10 言語で 300 のコーディング タスクが含まれていますが、英語に相当するものはありません。最も強力なモデルの合格率はわずか 63.1% であり、多言語エージェントのコーディング能力が成熟には程遠いことを示しています。以前のすべて英語のみのレビューと比較して、これは言語/地域/文化の側面を体系的にカバーする最初のコーディング会社ベンチマークです。重要度 78/100忠実なレポートを作成するためのディープリサーチライティングの再設計と監査
Redesigning and Auditing Deep Research Writing for Faithful Reports
AI インサイトarXiv の新しい論文では、CLAIMPROBE と CLAIMWRITER が提案されています。前者は詳細な調査レポートをステートメントレベルの監査に分割し、後者は情報源の事実に基づいて階層的な記述を構築します。従来のルーブリック評価と比較して、この方法ではスコアが安定している場合でも重要な証拠の欠落や誤った帰属が明らかになる可能性があり、これは既存の評価システムがレポートの信頼性を過大評価する可能性があることを意味します。重要度 66/100大規模な言語モデルはコンバージョン アトリビューションにおいて意味のあるタッチポイントを特定できるでしょうか?
Can Large Language Models Identify Meaningful Touchpoints in Conversion Attribution?
AI インサイトこの研究では、既存の協調フィルタリング アトリビューション手法が手動アノテーションを通じて多くの意味論的な暗黙的なタッチ ポイントを見逃していることを明らかにし、これらの関連性を識別する LLM の能力を体系的に評価しています。結果は、LLM がほとんどの暗黙的なタッチ ポイントを検出できるものの、まだ改善の余地があることを示しています。以前の純粋なヒューリスティック ルールと比較して、LLM はコンバージョン アトリビューションのためのセマンティック主導の増分パスを提供します。重要度 58/100関連エンティティarXiv科学方程式発見のためのテスト時間のスケーリング
Test-Time Scaling for Scientific Equation Discovery
AI インサイトこの研究では、科学方程式の発見という未解決のタスクにテスト時間のスケーリングを初めて適用し、Best-of-N、逐次改良、ツリー検索、および進化的手法を統合して計算用のビューを割り当て、固定予算の下では検索幅が支配的な要素であることを発見しました。数学やプログラミングなどのクローズドなタスクのみに焦点を当てていた以前の TTS と比較して、今回の TTS はオープンな科学的発見まで拡張されており、コンピューティング割り当て戦略をより探索的なタスクに移すことができることを意味します。重要度 68/100GreenBench: Apple Silicon 上のオープンソース LLM 推論のエネルギー効率と二酸化炭素排出量のベンチマーク
GreenBench: Benchmarking Energy Efficiency and Carbon Footprint of Open-Source LLM Inference on Apple Silicon
AI インサイトGreenBench は、Apple Silicon ユニファイド メモリ アーキテクチャの LLM 推論エネルギー効率ベンチマークを初めて提供します。推論中の M4 Pro の CPU+GPU パッケージの消費電力はわずか 0.47W であることが測定されています。データセンターのGPUに焦点を当てたこれまでのGreen AI研究と比較して、今回はローカル推論二酸化炭素排出量データのギャップを埋めるために、測定対象をApple Siliconまで拡張しました。重要度 70/100翻訳エラー検出のための多言語文埋め込みの評価:英語とギリシャ語の対照研究
Evaluating Multilingual Sentence Embeddings for Translation Error Detection:An English--Greek Contrastive Study
効率的な LLM 推論のための周期的ステップ層スキップの厳密に一致した監査: コンレイヤーとスウィフト、トレーニングされたルーティング代替案の補足分析
A rigor-matched audit of periodic-step layer skipping for efficient llm inference: conflayers versus swift, with a supplemental analysis of trained routing alternatives
AI インサイト定期的なレイヤー スキップの 2 つの方法 (ConfLayers と SWIFT) の 3 シードの厳密なマッチング監査では、SWIFT が 4 つのタスクとモデルの組み合わせのうち 3 つで最高の精度を示しているのに対し、ConfLayers は全体的に不利であることが示されています。これは、早期出口手法に関するこれまでの楽観的な推定には厳密な比較裏付けが欠けている可能性があり、研究者は検索ベースの自己投機的デコードにもっと注意を払う必要があることを意味します。重要度 65/100言語を超えた事実の一貫性のための潜在空間介入: 精度を低下させずに一貫性を向上
Latent-Space Intervention for Cross-Lingual Factual Consistency: Consistency Improvements without Accuracy Drops
プロンプトレベルのコンテキストからサイドレベルの WER に検出可能な変化なし: 本番口腔歴史コーパスの事前登録されたアブレーション
No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus
平均を超えるのではなく、既知の善に向けて平均を移動する: 推論時間の介入と重み付け統合がオープンエンド生成で何をもたらすか
Moving the Mean Toward the Known Good, Not Beyond It: What Inference-Time Interventions and Weight Consolidation Buy in Open-Ended Generation
VoiceCodeBench: 自動音声認識における正確な構造化トークンの回復の評価
VoiceCodeBench: Evaluating Exact Structured-Token Recovery in Automatic Speech Recognition
AI インサイト音声認識の評価は長い間 WER に依存してきましたが、WER は識別子やパスなどの正確なトークンのエラーをマスクします。 VoiceCodeBench は、追加のコンテキストなしで構造化トークンを回復する際の ASR の精度を具体的に評価するために、300 人の人間による録音と 1482 のターゲット エンティティを提供し、WER とダウンストリームの解析要件の間のギャップを埋めます。重要度 60/100因果関係による介入により、多言語言語モデルにおける類型学的に組織化された構文メカニズムが明らかに
Causal Interventions Reveal Typologically Organized Syntactic Mechanisms in Multilingual Language Models
AI インサイト機械的説明可能性の因果的介入を通じて、3 つの統語構造 (主語と動詞の一致、代名詞と性の一致、フィラーとギャップの抽出) の言語間メカニズム伝達の存在が 4 つの多言語モデルで検証されました。動作の類似性に関する以前の観察と比較して、内部メカニズムに直接介入したのはこれが初めてであり、多言語モデルが類型的な意味で構文処理経路を共有している可能性があることを示しています。重要度 78/100関連エンティティarXiv多者間の会話における意図認識のための交代ダイナミクスの活用
Leveraging Turn-taking Dynamics for Intent Recognition in Multi-party Conversations
AI インサイトこの論文では、マルチターン会話意図認識における話者切り替えの動的予測可能性を明示的にモデル化するための補助タスクとしてターン エントロピーを使用することを提案します。インタラクション構造を無視する以前の方法と比較して、さまざまな事前トレーニング済みモデルでの意図認識の精度が向上しました。これは、対話システムの意図理解が意味論的な内容だけに依存するのではなく、対話リズムの信号も利用し始めることを意味します。重要度 70/100関連エンティティarXiv幻覚信号は意地悪な変化である: なぜ単純なプローブで十分なのか
The Hallucination Signal Is a Mean Shift: Why Simple Probes Suffice
AI インサイトこの研究では、LLM幻覚検出の隠れ状態信号は主に単一の平均ドリフト方向であることがわかりました。この方向が削除されると、検出は失敗します。 L2 正規ロジスティック回帰は、0.952 AUROC で 12 の複雑なアーキテクチャに達するか、それを超えます。これは、以前のプローブの複雑さは、信号の非線形構造ではなく、主に高次元の共分散推定の難しさに起因していることを示しています。重要度 68/100関連エンティティarXivCoVA-SFT: 一連の視覚的抽象化のための大規模データセット
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions
AI インサイトCoVA-SFT には 51.9K のサンプル、222K を超えるマルチモーダル推論ステップが含まれており、5 つのレイアウト ファミリと 17 のタスクをカバーしており、純粋なテキスト推論で内部ビジュアル ワークスペースを構築するようにモデルに教えることを目的としています。視覚的な質問を散文にシリアル化するテキスト CoT と比較して、このデータセットは大規模なマルチステップの自己修正トレーニング コーパスを提供し、この方向のギャップを埋めます。重要度 65/100置き換えの幻想: 基盤モデル時代の特殊な機械学習モデルの再考
The Illusion of Replacement: Rethinking Specialized Machine Learning Models in the Foundation Model Era
AI インサイトこのレビューでは、159 件の論文と 9 つの主要なモダリティを通じて言語モデルとプロフェッショナル アーキテクチャを比較し、言語モデルが非常に小さなサンプルや離散記号タスクなどの特定のシナリオでのみ競合できることを指摘しました。中心的な問題は構造の保存と計算であり、タスクの実行ではありません。 「大きなモデルは普遍的な代替品である」という以前の物語と比較すると、これは代替理論の経験的修正です。重要度 68/100言語モデル表現に関する統一的な視点: Filler-Role 構造から機構的解釈可能性まで
A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
AI インサイトこの論文では、統合仮説としてテンソル積表現 (TPR) の使用を提案します。これは、加法アナロジー、線形検出、スパース オートエンコーダー、およびアクティベーション パッチを統合することが数学的および経験的に証明されています。比較的孤立していた以前の解釈可能性手法と比較して、これは初めて統合された基礎構造の観点を提供し、より体系的な理論的枠組みに向けて機械的解釈可能性を促進する可能性があります。重要度 65/100RouteSparse:予算付きロングコンテキストプリフィリングのための入力条件付きパターンルーティング
RouteSparse: Input-Conditional Pattern Routing for Budgeted Long-Context Prefilling
AI インサイトRouteSparse は、入力条件付きパターン ルーティングを提案し、ヘッダーとヒント セグメントごとに小さなスパース パターン ライブラリ内のパターンとバジェットを動的に選択し、低コストのプローブでユーティリティと不確実性を推定し、遅延を考慮したルーターの決定を行います。 MInference の固定オフライン モード割り当てと比較して、まばらに事前設定された適応粒度が各プロンプト セグメントにドリルダウンされ、エラー証明書が提供されるのはこれが初めてです。重要度 75/100すべてではない、またはなし: 会話中のスタンス検出のためのターゲット認識メモリ グラフの動的構築
Not All or None: Dynamic Construction of Target-aware Memory Graph for Conversational Stance Detection
LLM における認識と拒否の不一致: なぜモデルは構造的に答えられない質問に答えるのか
Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions
合成データの誤差許容度の定量化: 原子レベルのオペランドと演算子の摂動の研究
Quantifying Error Tolerance in Synthetic Data: An Atomic-level Operand vs. Operator Perturbation Study
中国言語の多言語ローマ字化エコシステムに向けて: 北京語と広東語のペアのケーススタディ
Toward a Cross-Lingual Romanization Ecosystem for Sinitic Languages: A Paired Mandarin-Cantonese Case Study
AI インサイトこの研究では、中国語横断ローマ字化の統一設計フレームワークを提案し、例として北京語と広東語の組み合わせを使用して 2 つのローマ字化計画を開発しています。各中国語の以前のローマ字化と比較して、このフレームワークは初めて音素と歴史的音韻間の対応を体系的に調整し、低リソースの方言 NLP の標準化された基盤を提供するデジタル インフラストラクチャとオープンソース プロセスを備えています。重要度 45/100文化的整合に向けて: アフリカの 5 つのコミュニティにわたるマルチモーダル AI ストーリーの人間中心の評価
Toward Cultural Alignment: Human-Centered Evaluation of Multimodal AI Stories Across Five African Communities
AI インサイトこの研究では、アフリカの 5 つのコミュニティの 19 人の文化的代表者を対象に混合方法による評価を実施し、マルチモーダル AI ストーリーの文化的整合性は、表面的な文化マーカーに依存するだけでなく、これらのマーカーに組み込まれた社会的、言語的、手続き的、視覚的コンテキストにも依存することが判明しました。文化的適応を判断するために識別可能な記号のみを使用した以前の研究と比較して、今回は5つのマークカテゴリーと8つの不協和音メカニズムを含む分類法を提案し、AIストーリー生成の文化的評価のための構造化されたフレームワークを提供します。重要度 60/100グループ固有の説明生成のための LLM の属性ベースのアクティベーション ステアリング
Attribute-Based Activation Steering of LLMs for Group-Specific Explanation Generation
セマンティクスによる音声のアンカー: 低リソース言語での自動音声認識のためのマルチモーダル アダプター メカニズム
Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages
患者が割り込んだとき: 臨床会話 AI の安全性を中断まで拡張する
When Patients Cut In: Extending Clinical Conversational AI Safety to Interruptions
AI インサイトこの記事では、臨床会話型 AI の安全性評価に患者の割り込みが初めて導入され、カスケード アーキテクチャ (ASR-LLM-TTS) が実際のインタラクションで必要な診断と治療の内容を失うことが明らかになりました。一般に患者が待つことを前提とする既存のベンチマークと比較して、この評価では 3 種類の中断を提案し、中断回復評価のギャップを埋めています。重要度 72/100大規模な言語モデルは一般的なオプションを体系的に優先します: MCQ 全体での証拠と緩和
Large Language Models Systematically Favor Popular Options: Evidence and Mitigation Across MCQs
AI インサイトLLM は、たとえ選択肢が間違っていたとしても、多肢選択問題で人気のある選択肢を体系的に優先し、精度が低下しても信頼水準は高いままになります。新しいベンチマーク PopMCQ は、6 つの制御戦略を使用してこのバイアスを定量化し、モデルは最も対立的なシナリオで一般的な誤差項を選択する傾向があります。これは、既存の評価がモデルの機能を過大評価している可能性があり、オプションの人気を評価変数として使用する必要があることを示唆しています。重要度 68/100モダリティ断層線: 構造的破損は脆弱なオムニモーダル推論を明らかにする
Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning
Targeted Retriever の微調整によるウズベキスタンの法的 RAG のクラウドおよびオンプレミス展開
Cloud and On-Premises Deployment of Uzbek Legal RAG via Targeted Retriever Fine-Tuning
AI インサイトこの論文では、ウズベキスタンの法律 RAG システムのクラウドとローカルのデュアルモード展開、リソースの少ない言語とハードウェアの制約に適応するようにターゲット検索者を微調整すること、および専門家による注釈付きの新しい 178 の検索ベンチマークの作成について報告しています。以前の一般的なリストと比較して、今回は初めて、この言語および法的シナリオに対して評価ベンチマークが構築され、知識 Q&A のローカライズ展開がリソースの少ない法的分野に拡大されました。重要度 65/100ERR+: 効率的かつ決定的な LLM 推論のための逐次エントロピー解決
ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning
超球面測地線マッチングによる教師なし潜在空間アライメント
Unsupervised Latent Space Alignment with Hyperspherical Geodesic Matching
滑らかな変圧器フィードフォワード ネットワークの曲率暗号解析
Curvature Cryptanalysis of Smooth Transformer Feed-Forward Networks
AI インサイトこの研究は、平滑化 2 層 FFN が、パラメーター、勾配、または内部アクティベーション アクセスを必要とせず、入力のみを選択でき、生の出力を読み取ることができるという条件下で、入力ヘシアンの 2 次漏洩チャネルを投影することによって隠れた構造を抽出できることを実証します。ホワイトボックスや内部状態に依存したこれまでのモデル抽出と比較して、今回初めて曲率情報を体系的に利用して構造抽出を実現し、識別可能性や安定性の条件を与えた。重要度 75/100等変層ニューラル ネットワーク: グラフ上の幾何学的輸送の学習
Equivariant Sheaf Neural Networks: Learning Geometric Transport on Graphs
停止ベクトル: 効率的な推論のための因果的ステアリング介入の内部化
The Halt Vector: Internalizing a Causal Steering Intervention for Efficient Reasoning
AI インサイトこの論文では、DeepSeek-R1-Distill-Qwen-7B の思考連鎖の長さは、安定した解答確率の約 2 倍であることがわかりました。冗長性は質問ごとに異なり、グローバルな長さのペナルティを削除することはできません。研究者らは、第 18 層で差分平均の方向を構築し、それを重みに内部化して、オンデマンドで推論を短縮する「ストップ ベクトル」を提案しました。これまでの外部からの罰や介入と比較して、今回は因果関係の発見が重みに固定化され、教師なし推論の圧縮に新たな道が開かれます。重要度 78/100学習されたルーティングを備えたプロセス システム用の保守的なハイブリッド グラフ ネットワーク
Conservative Hybrid Graph Networks for Process Systems with Learned Routing
AI インサイトこの論文では、学習されたルート、状態の割り当て、除去率を固定輸送方程式に埋め込み、予測されたルートに対して自然に質量保存を実現する保守混合グラフ ネットワーク (CHGN) を提案します。以前の制約のないグラフ ネットワークと比較すると、動的な産業プロセスに適合させる際に、ルーティングに安定した物理的意味を与えることが困難です。 CHGN は構造の保存を保証し、アイドル、遷移、アクティブ化などの複数の動作状態をカバーします。これは、産業プロセス モデリングが純粋なデータ駆動型から、物理的制約と学習を組み合わせた方向に移行することを意味します。重要度 70/100関連エンティティarXivセマンティック ID レコメンダーのオフポリシー評価: モデル独自のコード階層は役に立ちますか?
Off-Policy Evaluation for Semantic ID Recommenders: Does the Model's Own Code Hierarchy Help?
AI インサイトこの研究では、生成レコメンダーにおけるオフポリシー評価アクションの抽象化としてのセマンティック ID ツリーの有効性を評価しています。有効サンプル サイズが小さいため、本番ログでは項目ごとの OPE は絶望的ですが、プレフィックス クラスターへのエントリを周辺化することで、推定可能なサポートが回復され、エラーが減少します。これは、OPE がモデル独自のコード階層を活用し、以前の一般的な OPE メソッドと比較して、新しいモデルに埋め込まれた抽象化パスを追加することで安定性を向上できることを意味します。重要度 65/100一般的なコード化コンピューティングのための学習理論的基盤: ストラグラー設定
Learning-Theoretic Foundation for General Coded Computing: The Straggler Setting
AI インサイトこの論文では、学習理論を使用してエンコード計算の目標を再定義することを提案します。これにより、正確な回復は必要なくなりますが、代数構造を欠く DNN などの ML 負荷に近似解を適応させることができます。厳密な回復しきい値に依存していた以前のコーディング計算と比較して、これは理論的枠組みの適用可能な境界を変更します。重要度 72/100関連エンティティarXivRankShift: カテゴリカル シフトのデータベース内検出と説明
RankShift: In-Database Detection and Explanation of Categorical Shifts
AI インサイトRankShift は、分析データベース内のカテゴリ分布の変化を検出し、ピアソン スコアを通じて変化の原因となっているカテゴリを特定し、データベース クエリでアラートと上位貢献者を直接返すための新しい方法です。データを外部モデルにエクスポートする以前の方法と比較して、データベース内検出が実装され、3 つの主要なデータ セットに対するオートエンコーダーのパフォーマンスと一致します (AU 差 ≤ 0.001)。重要度 68/100DP-SGD の証明可能と監査可能なプライバシーのギャップを再考する
Revisiting the Provable-Auditable Privacy Gap of DP-SGD
CVaR-UCBVI の連続性のないニアミニマックス先行次数リグレット
Continuity-Free Near-Minimax Leading-Order Regret for CVaR-UCBVI
AI インサイトこの論文は、CVaR-UCBVI アルゴリズムが、連続性や密度の下限の仮定を必要とせずに、正規化されたリターン分布のほぼ最小から最大までのリグレス限界に到達できることを証明します。より良いレートを得るために密度の下限を必要とした以前の研究と比較して、これは理論的なギャップを埋め、テーブル設定の下での CVaR 強化学習のリグレス分析をより一般的な状況に前進させます。重要度 75/100V2TATC: 航空管制官の状況認識のための共同音声軌道埋め込みフレームワークとデータセット
V2TATC: A Joint Voice-Trajectory Embedding Framework and Dataset for Air Traffic Controller Situational Awareness
テキストおよびマルチメディア データに対する効果的なグラフとランクベースのコンテキスト埋め込み
Effective Graph and Rank-based Contextual Embeddings for Textual and Multimedia Data
検索およびグラフの畳み込みネットワーク分類のためのコンテキストを意識した解釈可能な表現
Context-Aware Interpretable Representations for Retrieval and Graph Convolutional Network Classification
AI インサイトこの論文は、視覚表現における従来のペアごとの類似性がデータ多様体の幾何学を無視し、表現が人間の認識と一致していないという問題に対処するために、コンテキストを意識した解釈可能な表現を提案します。以前の静的特徴と比較して、この方法は、検索とグラフ畳み込みネットワーク分類の有効性を考慮しながら、コンテキスト情報を低次元表現に統合します。これは、実験による検証が行われるまでは、解釈可能性と下流のパフォーマンスの間のトレードオフがさらに緩和される可能性があることを意味します。重要度 60/100関連エンティティarXiv風力発電のランプイベント予測と不確実性を認識した評価のためのハイブリッド セマンティック コンテキスト強化アンサンブル学習
Hybrid Semantic Context-Enhanced Ensemble Learning for Wind Power Ramp-Event Forecasting and Uncertainty-Aware Evaluation
AI インサイトarXiv に関する新しい論文では、セマンティック コンテキストを使用して風力発電の傾斜イベント予測を強化することを提案しています。風力タービンの動作データはテキストに変換され、大規模モデルに直接予測させるのではなく、統合モデルへの入力として埋め込まれます。以前の数値シーケンスの直接モデリングと比較して、この方法は特徴量エンジニアリングに言語モデルを使用し、SDWPF データ セットの 10/30/60 分の予測でテストされます。これは、NLP テクノロジーにより特殊な予測モデルを低コストで強化できることを意味しますが、完全な比較結果はまだ公開されていません。重要度 50/100NVE: バイクラスタリングのための分離性とカバレッジを意識した内部検証メトリック
NVE: A Separability and Coverage-Aware Internal Validation Metric for Biclustering
AI インサイトこの論文では、クラスター間の分離性とバイクラスターリングのデータ マトリックスのカバレッジの両方を評価するための NVE 内部検証インデックスを提案します。クラスター内の一貫性のみに焦点を当てる MSR および VE と比較して、NVE はクラスター間の識別と説明力の側面を補完して、二重クラスター検証指標の構造的なギャップを埋めます。重要度 62/100関連エンティティarXivスパース・クープマン・オートエンコーダーがマルチベースン・システムのローカル動的レジームを識別
Sparse Koopman Autoencoders Identify Local Dynamical Regimes in Multibasin Systems
AI インサイト従来のクープマン オートエンコーダは単一のグローバル線形埋め込みを前提としていますが、マルチベースン システムはこの前提を満たすことができません。この論文では、エンコーダが少数の潜在変数を自動的にアクティブ化し、領域ラベルを必要とせずに局所的な動的メカニズムを識別できるようにするスパース ターゲットを提案します。盆地またはグローバル埋め込みを事前に定義する必要があった以前の必要性と比較して、この方法は教師なし状態の発見を達成するために初めて検査可能な盆地モデリング原理としてスパース性を使用します。重要度 66/100PathBridger: オフラインの目標条件付き強化学習のためのサブゴールブリッジ
PathBridger: Subgoal Bridges for Offline Goal-Conditioned Reinforcement Learning
AI インサイトPathBridger は、オフラインのゴール条件付き強化学習における階層的手法がサブゴールの終点のみを指定し、パスが暗黙的であるという問題を解決するために、サブゴール間のパスを明示的にブリッジする新しいインターフェイスを提案します。長期的な値の推定を最適化したり、意思決定の期間を短縮したりするだけの以前の手法と比較して、状態空間パス モデリングを補完し、長期的なタスクの成功率を向上させることが期待されます。ただし、これはまだプレプリントであり、実証的な結果はありません。重要度 55/100推論モデルの隠された指令の選択的開示: 行動の非対称性とステアリング
Selective Disclosure of Hidden Directives in Reasoning Models: Behavioral Asymmetry and Steering
モンテカルロ木探索 (MCTS) と Gemini LLM フレームワークを使用した自律型 AI コーディング エージェントの開発
Development of an Autonomous AI Coding Agent using Monte Carlo Tree Search (MCTS) and Gemini LLM Frameworks
AI インサイトこの論文では、Gemini 2.5 Flash とカスタマイズされた MCTS を組み合わせた自律コーディング エージェントを提案します。従来の LLM の 1 回限りの生成と比較して、ツリー検索を通じて複雑なタスク コードの正確性が向上します。これは、AI プログラミング エージェントのエラー修正の方向に向けた漸進的な研究です。重要度 65/100温度適応型変換教師マッチング
Temperature-Adaptive Transformed Teacher Matching
AI インサイトこの論文では、サンプルレベルの逆温度更新を提案し、温度スケール化された教師分布と生徒予測の KL 発散を局所的に最小化することによって閉形式の解を導き出します。固定温度に依存していた以前の TTM と比較して、この方法はサンプルごとの適応的な温度調整を実現し、蒸留理論に新しい最適化次元を提供しますが、実験による検証はまだ行われていません。重要度 62/100PathGuide: オンポリシートランスポート調整による動的分類子不要のガイダンス
PathGuide: Dynamic Classifier-Free Guidance via On-Policy Transport Alignment
入口はロック、中はオープン:RLVR がソリューション スペースを狭める場所
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
AI インサイトRLVR は pass@1 を増加させますが、ポリシー ソリューション スペースは縮小し、カウントダウン タスクのカバレッジ率は最大 67% 低下します。以前に RLVR の精度向上に焦点を当てたのと比較して、軌道入口でのダイバーシティ損失を初めて定量化しました。これは、テスト中の拡張の利益逓減が、実行の失敗ではなく、解空間へのアクセスの制限によるものであることを示しています。重要度 75/100HalluPrism: マルチモーダル不確実性を判断するのではなく、診断する必要がある場合
HalluPrism: When Multimodal Uncertainty Should Diagnose, Not Decide
AI インサイトHalluPrism は、マルチモーダルな不確実性を「応答するかどうかの決定」から「失敗の原因の診断」に変え、視覚的な劣化、空白の画像、接地/関係プローブを通じて (V、L、A) 署名を生成します。 58,000 以上のサンプルの中で、画像除去の信頼保持が最も一般的ですが、接地/関係プローブの不安定性の方が失敗したファミリを区別するのに優れており、座標は個別に使用するよりも共同で解釈する必要があります。重要度 68/100PokaiTrainer: 信念状態検索を競争力のあるポケモン VGC に拡張
PokaiTrainer: Scaling Belief-State Search to Competitive Pok\'emon VGC
AI インサイトこの論文では、決定時間のバランスの取れた検索を、処理可能なサブゲーム (少数のアクション、オープン カード ゲーム) から、同時アクション、数百のアクション スペース、ランダムな結果と隠された情報を含むポケモン VGC イベントに拡張し、約 99% のシミュレーション一貫性で検索をサポートする Rust バトル エンジン PokaiEngine を起動します。これは、マルチプレイヤーの同時アクションや隠された情報のシナリオにおける以前のゲーム検索方法の拡張性がここで検証されたことを意味します。重要度 65/100RL-FAT: 公正な敵対的トレーニングのための強化学習
RL-FAT: Reinforcement Learning for Fair Adversarial Training
浅い決定木誘導のための適応型マルチ分岐
Adaptive Multi-Branching for Shallow Decision Tree Induction
AI インサイトこの論文では、微分可能なマルチパス分割と適応枝刈りを使用して浅い決定木をトレーニングする MBNDT を提案します。これにより、各内部ノードが順序付けされたしきい値と分岐マスクを学習できるようになり、深さバジェットの下での表現力の損失が軽減されます。従来のバイナリ ツリーの単一閾値の意思決定と比較して、同じ深さでのマルチブランチの意思決定により、解釈可能性を維持しながら精度が大幅に向上します。これは、表形式の予測の分野が短いパス内でより高い精度を達成できることを意味し、リソースに制約のあるシナリオでの解釈可能なモデルの適用を促進する可能性があります。重要度 62/100バッチを大きくすると LLM 強化学習のスケールが向上するのはいつですか?
When Do Larger Batches Help Scale LLM Reinforcement Learning?
切り取られたリウビリアン スペクトルからの散逸率回復のためのスペクトル識別可能性のしきい値
A Spectral Identifiability Threshold for Dissipative Rate Recovery from Truncated Liouvillian Spectra
AI インサイトこの論文では、6 ビット リンドブラッド モデルの切り詰められたリウヴィリアン スペクトルの散逸率を回復するために必要なモードの最小数を分析的に導出します。完全なスペクトルに依存した以前の分析と比較すると、これは母集団パターンにデコヒーレンス情報が含まれていないこと、および均一なデコヒーレンス識別可能性にはすべての D=2^n 非定常状態モードの保持が必要であることを証明しており、決定可能な理論的下限が与えられています。重要度 68/100専門家の成果であるガウス過程モデルにおける不確実性定量化の情報ベースのキャリブレーション
Information-Based Calibration of Uncertainty Quantification in Product-of-Experts Gaussian Process Models
AI インサイトこの論文では、情報ゲインの単調性とサブモジュール性を使用して校正率を定義し、ローカル データ分割によるエキスパート プロダクト GP モデルの事後分散の過大評価を修正する GP-pro-c を提案しています。計算の拡張のみに焦点を当て、分散歪みを無視した以前の GP-pro と比較して、今回は新しい理論主導の分散校正手法が追加され、スケーラビリティを維持しながら不確かさの定量化精度が向上しました。重要度 55/100時空間グラフのアンラーニングのための空間エントロピーベースの分割
Spatial Entropy based Partitioning for Spatiotemporal Graph Unlearning
サブグラフ仮想エッジ再構成による時空間グラフのアンラーニング
Unlearning on Spatio-Temporal Graphs through Subgraph Virtual Edge Reconstruction
AI インサイト時空間グラフのノード情報は空間と時間の 2 次元に沿ってグローバルに拡散するため、静的グラフの既存の忘却手法では単一のノードを効率的に削除することが困難であり、削除のコストは完全な再学習に近いものになります。この論文では、サブグラフ仮想エッジ再構成を通じて時空間グラフ上で効率的な忘却を実現する CallosumNet を提案します。これは、プライバシー コンプライアンスに基づくデータ削除が静的グラフから時系列の動的グラフ シナリオに拡張され、GDPR/CCPA コンプライアンスのための新しい技術的パスを提供することを意味しますが、この方法はまだ文書段階にあります。重要度 76/100乗算器に関するコンセンサスなしで複数ロボットを配置するための完全分散型 GNE アルゴリズム
Fully Distributed GNE Algorithms for Multi-Robot Placement without Consensus on Multipliers
AI インサイト乗数コンセンサスのない完全分散連続時間アルゴリズムは、共有線形等式制約を使用して GNEP を解くために提案されており、ラグランジュ乗数を交換することなく一般化ナッシュ均衡に収束し、通信オーバーヘッドを削減し、プライバシーを向上させることができます。乗数交換に依存した以前のコンセンサス手法と比較して、コンセンサスフリーの GNE ソリューションが単調性の高いゲームに実装され、マルチロボット配置タスクで検証されたのはこれが初めてです。重要度 60/100帰納法が限界に達した場合: 整数列ベンチマークにおける記述長の難しさと記憶のギャップ
Where Induction Runs Out: Description-Length Difficulty and the Memorisation Gap in Integer-Sequence Benchmarks
CPRD を使用した複数の長期疾患を持つ高齢患者の入院リスク予測のためのスケーラブルな臨床データ インフラストラクチャと比較 ML 評価
Scalable Clinical Data Infrastructure and Comparative ML Evaluation for Hospitalisation Risk Prediction in Elderly Patients with Multiple Long-Term Conditions using CPRD
AI インサイトこの記事では、CPRD Aurum に基づいてスケーラブルな患者タイムライン インフラストラクチャを構築し、高齢の多疾患患者の 12 か月入院リスクを予測します。主な変更点は、システムが、より優れているデフォルトの深層学習ではなく、TG-CNN を Lasso ロジスティック回帰およびランダム フォレストと比較することです。これは、EHR 予測研究がベンチマーク検証に対して後退しており、単純な解釈可能なモデルが依然として競争力がある可能性があることを意味します。重要度 75/100機能は 1 つだけですか、それとも複数ですか?フロンティアAI評価の経済的妥当性をテストする
One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation
AI インサイトこの研究では、初めて最先端モデルランキングの経済ベンチマークをテスト項目として扱い、潜在変数モデルを使用して12のベンチマークにおける421のモデル構成のパフォーマンスを調査し、経済能力が一般的なテスト能力から独立しているかどうかを調査します。これは、評価ベンチマークの妥当性が体系的に検証され始めていることを意味しており、ランキングに依存したAIの調達や監督のあり方が変わる可能性がある。重要度 62/100関連エンティティarXivEEG 反応時間デコードのための弱いイベント時間監視としての行動待ち時間
Behavioral Latency as Weak Event-Time Supervision for EEG Reaction-Time Decoding
AI インサイトこの研究では、行動遅延を弱い監視信号として扱い、固定ウィンドウのスカラー回帰からイベント時間事後モデリングへのEEG反応時間予測を再構築しています。単なるウィンドウレベルのラベルとしてのRTの以前の扱いと比較して、新しい方法は、デコードに参加するための時間的証拠として遅延を初めて使用し、被験者に依存しないタスクで検証されます。これは、RT デコードが純粋な回帰から確率的なイベント時間推定に移行することを意味します。重要度 75/100潜在計画は点群でも生き残れるか?幾何学的観測のためのアクション条件付き JEPA 世界モデル
Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations
SS-ESOAP: 物理学に基づいた学習のための自己スケール適応型事前調整
SS-ESOAP: Self-Scaled Adaptive Preconditioning for Physics-Informed Learning
リファレンスグラフティングは、サンドバッグ機能を引き出す際の微調整と一致します
Reference-Grafting Matches Fine-Tuning at Eliciting Sandbagged Capabilities
AI インサイトリファレンスグラフティングは、アクティベーション座標を正直なリファレンス値に設定し、少数の回路のみを編集し、11 個のパスワードロックされたモデルの正直なサンドバッグギャップの 94% ~ 101% を復元します。この効果は、重みの更新を必要とせずに微調整するのと同等です。以前の追加的アクティベーション ガイダンスの失敗と比較して、アクティベーション編集がサンドバッグの隠された能力を効果的に明らかにし、再トレーニングなしで最先端のモデルのセキュリティ評価のための実用的なツールを提供できることを示しています。重要度 68/100モデル生物における土嚢の位置を特定し解除するための因果モデル
A Causal Model for Locating and Unlocking Sandbagging in Model Organisms
AI インサイトこの論文では、サンドバッグ動作の因果モデルを初めて提案しています。つまり、初期の層が残留フローの 1 つの軸にインテントを書き込み、後の層がその軸を読み取って回答を送信します。土嚢を評価の歪みの問題としてのみ捉えていた以前の見解と比較して、この研究では土嚢を位置特定可能で介入可能なメカニズムとして位置づけ、逆ロック解除の道を提供します。重要度 68/100教師の誤った指定の下での知識の蒸留: 教師の模倣とタスクのパフォーマンスの間のギャップの順序パラメーター分析
Knowledge Distillation under Teacher Misspecification: An Order-Parameter Analysis of the Gap between Teacher Mimicry and Task Performance
AI インサイトこの研究は、順序パラメータ分析を通じて、実際の教師、教師、生徒の三者構成のソフト委員会マシンの下で教師が間違った課題を出した場合の「教師と生徒の違い」と「生徒の課題の間違い」との間の非等価な関係を明確に示しています。教師と生徒の違いを蒸留の進捗状況の代理指標として使用するこれまでの一般的な手法と比較して、この研究は、代理指標の歪みの条件を理論的に初めて明らかにしました。つまり、共有された潜在的な要因を教師が表現できない場合、教師と生徒の不一致を最小限に抑えてもタスクのパフォーマンスの向上が保証されないということです。重要度 65/10024時間の手首の動きから人間の健康と病気を学ぶ
Learning Human Health and Diseases from 24-hour Wrist Movement
非侵襲的な体組成推定のためのターゲット認識状態適応 $p$-Dirichlet グラフ神経回帰
Target-Aware State-Adaptive $p$-Dirichlet Graph Neural Regression for Non-Invasive Body-Composition Estimation
AI インサイトこの論文では、DXA に依存する侵襲的検出に代わって、非侵襲的身体測定から体脂肪率、骨密度、四肢除脂肪量を推定する、ターゲット認識型の状態適応型 p-ディリクレ グラフ神経回帰フレームワークを提案します。静的グラフに基づく以前の回帰手法と比較して、このフレームワークは、状態適応型順オイラー離散化を通じて参加者類似度グラフ上の隠れ状態を伝播し、グラフのエネルギー フローをターゲットに合わせて動的に調整できるようにします。これは、グラフ ニューラル ネットワークが健康指標の予測において対象の知覚の静的表現から動的伝播に移行したことを意味しますが、まだ論文の段階にあり、臨床検証は行われていません。重要度 70/100オープンセット牛の口輪の識別: 漏れを制御したベンチマークと評価プロトコル
Open-Set Cattle Muzzle Identification: A Leakage-Controlled Benchmark and Evaluation Protocol
AI インサイトこの研究は、牛の鼻紋認識を閉集合問題から開集合認識に再構築し、未知の個人の拒否と再訓練なしの増分登録をサポートします。以前の閉集合の仮定と比較して、ID 素セグメンテーションやフォールドバイフォールド再トレーニングなどの新しい漏洩制御評価プロトコルが追加され、ベンチマーク テストが実際の展開に近づきます。重要度 62/100構造化されたビデオ プロンプトによるビデオ言語モデルの時空間推論の改善
Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting
AI インサイトこの研究では、推論中にビデオ入力に明示的な時空間構造アンカーを追加するための構造化ビデオ プロンプトを提案します。これにより、トレーニングやデコードの変更を行わずにビデオ言語モデルの時空間推論能力を向上させることができます。これは、モデルの重みの微調整や複雑なデコード制約に依存していた以前のアプローチに比べて、軽量でトレーニングに依存しない推論時間の改善です。つまり、視覚的な証拠を整理する方法自体がパフォーマンス向上の源となり得ることを意味します。 2 つのベンチマークと 2 つのオープンソース モデルで有効であることが検証されていますが、具体的な値は示されていません。重要度 72/100関連エンティティarXivBaryCache によるメモリ効率の高いトレーニング不要の拡散トランスフォーマーの高速化
Memory-Efficient Training-Free Acceleration of Diffusion Transformers with BaryCache
AI インサイトBaryCache は、重心の外挿に基づいたトレーニング不要の加速方法を提案します。既存のキャッシュ アクセラレーションと比較して、グラフィックス メモリの使用量の増加を回避しながら、冗長な計算を削減します。この実験では、画像とビデオの生成について説明します。これは、推論バッチ サイズがキャッシュされた中間状態のビデオ メモリによって制限されなくなり、DiT 導入コストを削減するための新しいパスを提供することを意味します。重要度 68/100FrameScope: 自動運転車システムにおけるストリーム アクティブ ラーニングのための時間データ評価
FrameScope: Temporal Data Valuation for Stream Active Learning in Autonomous Vehicle Systems
AI インサイトFrameScopeは、ストリーミング・アクティブ・ラーニングのための自動運転ストリーミング・ビジュアル・データのための時系列データ評価フレームワークを提案します。ヒューリスティック サンプリングに依存した以前の継続学習と比較して、フレーム間の時間的ダイナミクスを明示的にモデル化し、冗長なフレームや重要な機会の逸失を回避します。これは、自動運転オンライン学習のデータ選択基準が静的な特徴から時間的な価値に移行することを意味します。重要度 62/100AdaptAV: クラウドベースの Oracle を使用した自動運転車向けのビジョン モデルの継続的適応
AdaptAV: Continuous Adaption of Vision Models for Autonomous Vehicles Using Cloud-based Oracle
AI インサイトこの論文では、クラウドの高性能オラクル モデルを使用して車両の軽量ビジョン モデルを継続的に再トレーニングし、更新情報を送り返す AdaptAV システムを提案しています。以前のモデルの静的展開やオフライン更新と比較して、AdaptAV はクラウドカーの閉ループ学習パラダイムを構築し、新しいシナリオにおける小さなモデルの弱い一般化の問題に直接対処します。ただし、まだ提案段階にあり、実験による検証は行われていない。重要度 65/100多重露出 HDR イメージング: ピクセルレベルおよびフィーチャレベルの再構成手法のレビュー
Multi-exposure HDR Imaging: A Review of Pixel-level and Feature-level Reconstruction Methods
AI インサイトarXiv での多重露出 HDR イメージングのレビューです。ピクセルレベルと特徴レベルの再構成方法を体系的に整理し、アライメントドメインとフュージョンドメインに基づいて深層学習ソリューションを分類します。以前の散在的な研究と比較して、このレビューでは MEF とゴースト除去を初めて統一フレームワークに統合し、その後の方法比較のための調整を提供します。重要度 45/100関連エンティティarXivビデオ推論のためのマルチエージェントの自己改善型強化学習
Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning
AI インサイトトレーニング可能な Grounder と Frozen Verifier を使用してビデオ推論におけるマルチエージェント フレームワークを形成し、グループ相対ポリシー勾配を使用して Frozen Verifier のスコアをトレーニングに導入することが提案されています。推論中の再配置のみに使用されていた以前のバリデーターと比較して、この方法では、凍結されたモデルがトレーニングをガイドすることもできるため、バリデーターを微調整する必要がなく、一時的な証拠の選択機能が向上します。重要度 68/100標本ラベルデジタル化のための自動パイプライン
Automated pipeline for herbarium label digitization
既製の VLM を使用したスケーラブルなベクター グラフィックス生成のための制約付き反復改良の評価
Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs
レートと歪みのトレードオフを改善した分散型セマンティック セグメンテーション
Distributed Semantic Segmentation With Improved Rate-Distortion Trade-Off
AI インサイト非常に低いビット レートでのレート歪み性能を同時に改善するために、2 つの新しいソース エンコーダが提案されています。単一のエンコーダをバインドし、ネットワーク アーキテクチャを調査しない以前の方法と比較して、今回はエンコーダ設計を通じてより優れた RD トレードオフを実現し、エッジクラウド分散セマンティック セグメンテーションの新しいパスを提供します。重要度 65/100周波数の不変性ではなくデータの多様性: 圧縮に強いディープフェイク検出に関する管理された自己監査型の研究
Data Diversity, Not Frequency Invariance: A Controlled and Self-Audited Study of Compression-Robust Deepfake Detection
AI インサイトarXiv の新しい研究では、事前に登録された対照実験を通じて、圧縮に強いディープフェイク検出の鍵は周波数の不変性ではなく、データの多様性であることが判明しました。強化されたマッチングの通常の EfficientNet-B0 は、FaceForensics++ のすべての圧縮レベルで特殊な周波数フロー モデル CAFRL を破り、CRF40 の下で 3.66 高い AUC を達成しました。これは、周波数特徴を強調した以前の方法では圧縮不変性の役割を過大評価していた可能性があり、マルチ品質データ トレーニングの方がより現実的な方向であることを意味します。重要度 68/100FLM: 生成画像圧縮のための周波数認識言語モデル
FLM: Frequency-Aware Language Models for Generative Image Compression
360 度ビデオ向けの投影対応のエンドツーエンド学習ビデオ圧縮
Projection-Aware End-to-End Learned Video Compression for 360-Degree Video
AI インサイトこの論文では、スケールスペース フロー モデルと JVET 標準シーケンスを使用して、エンドツーエンドのニューラル圧縮に対する 7 つの 360 度投影フォーマットの影響を評価しています。一般的に投影の違いを無視していた以前のニューラル エンコーダと比較して、この研究は、レート歪みパフォーマンスに対する投影知覚の増分効果を体系的に比較した最初の研究です。重要度 60/100プライベート属性推論に対するウェアラブル VLM の防御
Defending Wearable VLMs Against Private Attribute Inference
AI インサイトこの文書では、ウェアラブル VLM のプライバシー漏洩リスクについて、最終的なテキストではなく中間のビジュアル トークンに初めて焦点を当てています。出力応答のみに焦点を当てた以前の研究と比較して、セグメンテーション推論における傍受された視覚トークンの漏洩表面が追加され、プライバシーとユーティリティの統合防御アイデアが提案されました。これは、ウェアラブル AI のプライバシー保護を端末側から伝送リンクまで拡張する必要があることを意味します。重要度 65/100樹木ではなくスタンドを成長させる: ジョイントキャノピー生成によりクラウン恥ずかしがりを再現
Growing a Stand, Not a Tree: Joint Canopy Generation Reproduces Crown Shyness
AI インサイトこの研究では、樹冠間のみに存在する空間パターンである樹冠内気を生成モデリングのテストケースとして取り上げ、モデルが樹木間の注意を通じて複数の物体間の結合構造を捉える必要があるように、フローマッチングに基づく集合生成手法を提案しています。個別のツリーを独立して生成する場合と比較して、共同生成では誤差が半減し、セットレベルのパターンを学習できることが証明されました。重要度 62/100SNF ベンチ: 長期固定カメラ ビデオ生成における自然フローから静的ドリフトを分離する
SNF-Bench: Separating Static Drift from Natural Flow in Long-Horizon Fixed-Camera Video Generation
視覚的な物語を織り交ぜる: 原子的な視覚的マッチングを超えたエージェント的な画像バンドルの構成
Weaving Visual Narratives: Agentic Image Bundle Composition Beyond Atomic Visual Matching
AI インサイトこの論文では、画像バンドル結合 (IBC) の新しいパラダイムを提案します。これは、検索の目標を、単一画像のスコアリングと並べ替えから、大規模な写真ライブラリからの関連画像バンドルの動的結合に変更します。従来のアトミックな視覚マッチングと比較して、IBC は個人の写真ライブラリのナラティブ検索に新しい方向性を提供するために、非分解結合相関と組み合わせ爆発問題をモデル化する必要があります。重要度 68/100命令の抽出: 視覚的な例としてのテキスト命令
Instruction Distillation: Text Instructions as Visual Examples
AI インサイトこの論文では命令の蒸留を提案しています。大規模なマルチモーダル モデルがトレーニング画像ごとにテキスト認識命令を生成し、視覚的なコンテキスト学習のために画像の例をテキストの例に置き換えて、推論中のトークンの消費を削減しながらクラス内の多様性を維持します。カテゴリごとに 1 つの記述しかなかった従来と比較して、今回はグラフに従って指示が生成されるため、大規模な K をきめ細かく分類するための展開のしきい値が低くなります。重要度 65/100文書視覚言語モデルにおけるきめ細かい知覚のための状態条件付き視覚証拠検索
State-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models
AI インサイトこの論文では、文書解析における視覚認識を状態条件検索としてモデル化し、デコード中にグローバル圧縮視覚トークンに繰り返しアクセスする代わりに、オンデマンドの証拠取得を実現する SCVER 法を提案します。これは、以前のグローバル圧縮表現の非効率な計算と比較して、きめ細かい知覚により推論の効率と精度が向上することが期待されることを意味しますが、まだプレプリントの段階にあり、実験結果を検証する必要があります。重要度 70/100視覚的な境界を超えて: 映画 RAG のシーン セグメンテーションを再考する
Beyond Visual Boundaries: Rethinking Scene Segmentation for Movie RAG
AI インサイト本稿では、映画RAGの検索単位としてシーン分割を提案する。以前の固定長セグメントと比較して、ストーリーレベルの意味境界が初めてビデオ検索に体系的に導入されました。要約では問題設定のみが説明されており、実験結果はまだありませんが、RAG の品質がセグメンテーション粒度の方向によって制限されることを示しています。重要度 62/100TopoAgent: 大規模な視覚言語モデルを使用した図からグラフへのトポロジ抽出のための、構造を認識した知覚から推論までのフレームワーク
TopoAgent: A Structure-Aware Perception-to-Reasoning Framework for Diagram-to-Graph Topology Extraction with Large Vision-Language Models
AI インサイトTopoAgent は、構造を認識した知覚推論フレームワークを提案し、構造グラフからグラフ トポロジを抽出するために使用される人間検証ベンチマーク TopoBench-180 を備えています。大域的推論に依存する以前の LVLM と比較して、この方法は知覚とトポロジカル推論を分離し、再現可能な 180 グラフのベンチマークを追加しますが、パフォーマンスはまだ公開データによって検証されていません。重要度 64/100確率的液体変形場: 動的 3D ガウス スプラッティングのための閉じた形式の連続時間セルの SDE 一般化
Stochastic Liquid Deformation Fields: An SDE Generalisation of Closed-Form Continuous-Time Cells for Dynamic 3D Gaussian Splatting
AI インサイトこの研究では、動的 3D ガウス スプラッシュの変形フィールドを、決定論的な CfC ユニットからノイズ項を追加する SDE バージョンに拡張します。液体ニューラル ネットワークの確率論的な堅牢性を維持するためにトレーニング中にガウス摂動が注入され、推論コストは変化しません。以前の純粋に決定論的な閉形式ソリューションと比較して、これは破棄されたランダム項を補償し、連続時間モデリングを液体ネットワークの元の設計に近づけます。重要度 70/100MANTLE: モジュール式アップリンク原理を使用した適応的な現場惑星知覚のためのフレームワーク
MANTLE: A Framework for Adaptive In-Situ Planetary Perception Using a Modular Uplink Principle
Inter-3D VQA: 3D 時空間に基づいた視覚的な質問応答のための路側マルチモーダル ベンチマーク
Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering
AI インサイトInter-3D VQA は、交差点シーン向けの初の 3D 時空間視覚的質問応答ベンチマークを提案し、同期された点群とマルチビュー画像に基づいて 407,000 個の QA ペアを構築し、車線レベルの位置決め、物体の関係、動作パターン、および衝突寸前推論をカバーします。主に自車の視点や 2D 路側ビデオに基づいていた以前のベンチマークと比較して、この研究では 2D 知覚から実際の距離とトポロジーの 3D に基づいた推論への進歩を評価します。重要度 65/100FairReL: 公平性を意識した表現学習を使用したディープフェイク検出
FairReL: Deepfake Detection using Fairness-Aware Representation Learning
表現学習を超えて: 3D 脳 MRI の結合埋め込み予測生成の系統的研究
Beyond Representation Learning: A Systematic Study of Joint-Embedding Predictive Generation for 3D Brain MRI
AI インサイトMed-D-JEPA は、マスク予測、表現アライメント、トークンごとの拡散、反復サンプリングを組み合わせて、D-JEPA フレームワーク システムを 3D 脳 MRI 生成に適応させます。表現学習に重点を置いた以前の JEPA と自然画像の検証のみを行っていた D-JEPA と比較して、3D 医療画像を生成する機能を体系的に調査するのは今回が初めてです。これは、JEPA のような生成パラダイムが医療画像の分野にも拡張されることが期待されていることを意味します。重要度 65/100予測符号化階層を使用したブラインド立体視全方向画質評価
Blind Stereoscopic Omnidirectional Image Quality Assessment Using Predictive Coding Hierarchy
顔編集用のテキストガイド付きモデルの大規模評価
A Large-scale Evaluation of Text-guided Models for Facial Editing
AI インサイトこの論文は、テキスト ガイド付きモデルの顔編集機能の大規模な評価を初めて実施し、これまでの取り組みではシーン全体の編集に焦点を当て、顔固有の編集を無視していたというギャップを埋めました。 GAN の不安定性や 3DMM がジェスチャー表現のみをサポートしているという事実と比較すると、テキストガイド付きモデルは安定していて多様性がありますが、体系的な検証が不足しています。この評価は、顔編集モデルの選択に定量化可能な基礎を提供します。重要度 70/100FigMirror: 基礎を作り、コーディングし、プロットする
FigMirror: Ground It, Code It, Plot It
テキスト駆動の芸術的なステージング: 絵画からのポーズ、照明、カメラの参照
Text-Driven Artistic Staging: Pose, Lighting, and Camera References from Paintings
BlobBoards: 正確なポーズのための堅牢なマーカー
BlobBoards: Robust Markers for Accurate Pose
AI インサイトBlobBoards は、高密度マルチスケール ガウス ブロブ フィールドを使用して共同検出、認識、姿勢推定を実現する新しい基準マーキング システムです。 AprilTag と比較して、中央値の翻訳誤差は小型プレートで 89%、大型プレートで 70% 減少し、精度が大幅に向上しました。重要度 68/100MWIR-4-プラスチック: 中波赤外線ハイパースペクトルイメージングと機械学習を使用した複雑な耐用年数が終了した工業用プラスチックの特定
MWIR-4-Plastic: The Identification of Complex End-of-Life Industrial Plastic using Mid-wave Infrared Hyperspectral Imaging and Machine Learning
AI インサイトこの研究では、中波赤外ハイパースペクトルイメージングと機械学習を組み合わせて使用し、空間的に分解できない既存の一点赤外および実験室用HSIの欠点を補うために廃黒色工業用プラスチックを特定し、完全な部品ではなく断片でトレーニングすることを提案しています。これは、選別技術が手動選択に依存するものから自動バッチ処理に移行したことを意味しますが、データセットは依然として研究室によって管理されており、実際の生産ラインの汎用性を検証する必要があります。重要度 60/100ドローンおよび衛星画像のピクセル単位の地理位置登録
Pixel-wise Geo-registration of Drone and Satellite Images
ReconSplat: 観察されたビューを超えた一般化可能な 3D シーンの再構築
ReconSplat: Generalizable 3D Scene Reconstruction Beyond Observed Views
AI インサイトReconSplat は、中間表現として 3D ガウス スプラッターを使用するフィードフォワード 3D シーン再構成モデルで、マルチビュー潜在拡散モデルと組み合わせて、リファイナーとリペアラーの両方として機能し、変分 3D 潜在特徴を使用して拡散プロセスをガイドして幾何学的一貫性を強化します。未観察領域の生成と幾何学的一貫性の間でトレードオフがある以前の再構成方法と比較して、幾何学的に位置合わせされた新しいビューと正確な深度推定を同時に生成することを目的としています。重要度 70/100粗いものから細かいものまで: 医用画像合成のための反復敵対的ニューラル セルラー オートマトン
Coarse to Fine: Iterative Adversarial Neural Cellular Automata for Medical Image Synthesis
AI インサイトこの研究では、医療画像合成用の初の軽量汎用 NCA ベース GAN である StyleGANCA を提案します。高価な主流の生成モデルと比較して、リソースに制約のあるハードウェア上で潜在的に制御可能な画像生成を可能にし、合成データのしきい値を下げます。重要度 70/100mmIR: 3D ミリ波レーダー ADC 合成のための周波数空間逆レンダリング
mmIR: Frequency-Space Inverse Rendering for 3D Millimeter-Wave Radar ADC Synthesis
ActiveAugment: 深層学習における拡張選択のためのオンライン アクティブ ラーニング
ActiveAugment: Online Active Learning for Augmentation Selection in Deep Learning
AI インサイトActiveAugment は、データ拡張の選択をオンラインの能動学習問題としてモデル化し、各ミニバッチがモデルの予測の不確実性と機能の違いに基づいて最も脆弱な拡張ビューを選択します。静的またはランダムな強化と比較して、強化戦略をモデルの現在の学習状態に初めてリアルタイムでバインドします。これは、動的適応トレーニング方法に新たに追加されたものです。重要度 68/100NBS: ノーバイアスステレオ
NBS: No Bias Stereo
FractureFields: 破壊された 3D ガウス シミュレーションのための接触認識バイナリ マルチフィールド転送
FractureFields: Contact-Aware Binary Multi-Field Transfer for Fractured 3D Gaussian Simulation
AI インサイトFractureFields は、破砕後も単一のオイラー速度場を使用するガウス物質点法 (Gaussia-MPM) パイプラインによって引き起こされるフラグメント間の運動量漏れの問題を解決するために、フラグメントごとに独立した質量/運動量フィールドを構築し、それらを個別に進める接触認識型の伝達方法を提案します。以前の単一グリッド フィールドと比較して、この方法では単一の P2G で個別のフィールドの構築が完了し、残留接着と非物理的伸縮が排除されます。これは、物理的に統合された 3D ガウス シミュレーションにより、破壊シナリオにおけるトポロジカル適応動的精度の向上を達成できることを意味します。ただし、この論文は arXiv のプレプリントであり、まだ公開された評価データはありません。重要度 68/100RoSe-SLAM: 動的単眼ビデオからの堅牢なセマンティック認識ガウス スプラッティング SLAM
RoSe-SLAM: Robust Semantic-Aware Gaussian Splatting SLAM from Dynamic Monocular Videos
検証ベースのコンテキストエンジニアリングによる完全自動医用画像コード生成に向けて
Towards Fully Automated Medical Imaging Code Generation via Validation-based Context Engineering
AI インサイトAutoMedImg は、計画と検証の 2 段階を経て医用画像処理コードを自動生成するマルチエージェント フレームワークを提案します。多くの手動介入を必要とする一般的な LLM と比較して、完全に自動化されたパイプラインを実現します。重要な機能強化は、コード生成プロセスに検証メカニズムを組み込むことです。重要度 68/100DocIntent: 現実世界のドキュメントの視覚的な質問応答のための、応答性ガイドに基づくエージェント復元
DocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering
ランジュバン正則化 SVGD の定量的ターゲットの収束とカオスの均一時間伝播
Quantitative Target Convergence and Uniform-in-Time Propagation of Chaos for Langevin-Regularized SVGD
AI インサイトこの論文は、ランジュバン正則化 SVGD の定量的ターゲット収束と均一時間伝播カオスを確立し、スタイン相互作用がランジュバン ドリフトよりはるかに小さい必要がなく、収縮性粒子の結合も必要ないことを証明します。これにより、小規模な相互作用や収縮カップリングに依存していた以前の解析と比較して、理論的条件が大幅に緩和されます。重要度 68/100製品参照離散拡散の情報幾何学: インタラクションの増大の複雑さと最適なスケジューリング
The information geometry of product-reference discrete diffusion: Interaction growth complexity and optimal scheduling
AI インサイトこの論文では、KL 離散化誤差と離散拡散モデルのシングルステップ上限を正確に特徴付けるためのパス メトリックとしてインタラクティブ成長複雑性 (IGC) を提案し、単変量 IGC 密度を使用してステップ サイズの選択が反復の複雑さに及ぼす影響を分析します。連続時間近似やヒューリスティック スケジューリングに依存することが多かった以前の離散拡散と比較して、これは最適なスケジューリングの理論的基盤を提供します。重要度 70/100ランク制限行列 LASSO のグローバル最小値のシャープ制限アイソメトリしきい値
Sharp Restricted Isometry Thresholds for Global Minima of Rank-Restricted Matrix LASSO
AI インサイトこの論文では、ランク制限行列 LASSO のグローバル最小回復に対するシャープ RIP しきい値 δ_sharp(t) を決定し、2 つの段落で閉じた形式の式を示します。十分条件のみに関する以前の知識と比較すると、この結果は必要かつ十分であり、誤差限界は検索ランクとは無関係であり、低ランク行列の回復に正確な理論的境界を提供します。重要度 70/100正則化パラメータに対する指数および多項式依存性を伴う経験的シンクホーン ポテンシャルの均一な統計的収束
Uniform Statistical Convergence of Empirical Sinkhorn Potentials with Exponential and Polynomial Dependence on the Regularization Parameter
AI インサイトこの研究は、一様損失下の経験的シンクホーンポテンシャルの非漸近統計率は n^{-1/2} であるが、定数は 1/ε とともに指数関数的に増加することを証明しています。次に、この速度と多項式で一定の成長を維持するための条件が与えられます。これは、エントロピー正規 OT ポテンシャル推定の収束が初めて視覚的に特徴付けられ、その後の理論的改善のためのベンチマークが提供されたことを意味します。重要度 50/100いつ決定すべきかの決定: 分布シフト下での運用の準最適性のテスト
Deciding When to Decide: Testing Operational Suboptimality Under Distributional Shift
ニューラル ODE により、時間とともに変化する共変量とマーカーの軌跡との複雑な関連パターンを推定するための線形混合効果モデルが強化されました
Neural ODE enhanced linear mixed effect models for estimating complex association patterns of time-varying covariates with the marker trajectory
AI インサイトこの論文では、ニューラル ODE-LMM を提案します。これは、古典的な線形混合効果モデルにニューラル ODE を埋め込み、ベクトル場の学習を通じて共変量軌跡を連続時間の隠れ状態にエンコードし、固定効果とランダム効果の設計を推進します。エクスポージャーと結果の関数形式を事前に指定する必要がある従来の LMM と比較して、新しい方法はデータから複雑な時間変化する相関パターンを学習し、モデル設定のバイアスを軽減できます。重要度 65/100欠損、測定誤差、不均一性を共同モデリングするための深層潜在変数フレームワーク
A Deep Latent Variable Framework for Jointly Modeling Missingness, Measurement Error, and Heterogeneity
AI インサイトこの研究は、深層潜在変数モデルにおける欠損データ、測定誤差、および母集団の不均一性を共同で処理する統一された確率的フレームワークを初めて提案します。これら 3 種類の問題を個別に扱っていた以前の方法と比較して、その階層ツリー ルーティング VAE は、MCAR/MAR/MNAR メカニズムとサブグループのグローバル共有構造を同時にモデル化し、方法論レベルで統合された革新となります。重要度 60/100関連エンティティarXivトークン予測による表現の学習: 幾何学、近似、およびダウンストリーム保証
Learning Representations through Token Prediction: Geometry, Approximation, and Downstream Guarantees
文脈に沿った一貫したリスク尺度によるマルチクラス、マルチグループ分類問題の公平性
Fairness in multi-class multi-group classification problems via contextial coherent risk measures
AI インサイトこの論文では、コンテキスト一貫性のあるリスク尺度を使用して、マルチクラスおよびマルチグループの公平な分類器を設計し、ベクトル値の機密属性と重複するグループを処理し、個人の権利を考慮することを提案します。単一の機密属性または 2 つのカテゴリのみを扱った以前のマルチグループの公平性研究と比較して、この方法は、コヒーレントなリスク測定システムを初めてマルチクラスおよびマルチグループの公平性の最適化に導入し、専用の数値ソリューションを備えています。重要度 70/100関連エンティティarXivトレーニングサンプルからの非凸勾配流に沿った集団リスク曲線の推定
Estimating Population-Risk Curves Along Nonconvex Gradient Flows from the Training Sample
マルチクラス分類情報ジオメトリにおける有益なラベルの欠落と過剰なリスク
Informative Label Missingness in Multiclass Classification Information Geometry and Excess Risk
AI インサイトこの論文では、情報ラベルが存在しないと、完全にラベル付けされた分類器と部分的にラベル付けされた分類器の効率ランキングが変わる可能性があることを提案し、情報幾何学を使用して過剰リスクの二次展開を導き出します。デフォルトが完全にランダムである以前の設定と比較して、欠損パターン自体がモデル情報を保持します。これは、分類効率理論に新たに追加されたものです。重要度 75/100関連エンティティarXivトレーニング分布における帰納的バイアスを通じて許容可能な仮説の幾何学を学習する
Learning the Geometry of Admissible Hypotheses through Inductive Bias in Training Distributions
AI インサイトこの論文では、偏微分方程式 (PDE) の許容可能な連続潜在表現を学習するために、科学的帰納バイアス (スパース性、論理的依存性、物理的許容性など) をトレーニング分布に直接埋め込むことを提案します。特定のデータセットまたは明示的な監視に依存した以前の PDE 表現学習方法と比較して、この論文では、仮説空間の構造的制約をトレーニング データ生成プロセスに転送し、モデルが結合された仮説空間を探索できるようにします。これは、科学的発見における「許容可能な仮説」の幾何学的構造を暗黙的にエンコードできることを意味し、これにより手動の注釈や完全なシミュレーション データへの依存が軽減される可能性があります。実際の PDE 検出タスクでの検証に注目する価値があります。重要度 70/100量子信号処理による表現学習
Representation Learning with Quantum Signal Processing
AI インサイトこの論文は、学習を表す可解決モデルとして量子信号処理を確立し、任意の深さで量子ニューラル タンジェント カーネルの平均と分散を正確に計算し、その対角項がハールランダム性で自己平均しないことを発見しました。これにより、量子ニューラル ネットワークにおける表現学習の正確な統計的特徴付けが初めて提供され、フリーズされたカーネルまたは集合平均の以前の仮定が打ち破られました。重要度 68/100不定カーネルによる高速密度推定のための符号付きランダム フーリエ特徴
Signed random Fourier features for fast density estimation with indefinite kernels
AI インサイトこの論文では、符号付き確率フーリエ特徴を提案します。これにより、RFF の適用範囲が正定カーネルから不定カーネルに拡張され、放物線カーネルなどの一般的に使用される KDE カーネルでも O(N) 加速を達成できます。 RFF が正定値カーネルのみをサポートするという以前の制限と比較すると、これはメソッド レベルでの重要な拡張であり、大規模な密度推定の計算コストが大幅に削減されることが期待されます。重要度 60/100フィードを超えたコンテンツ探索: クリエイターの供給と共有コーパス
Content Exploration Beyond the Feed: Creator Supply and the Shared Corpus
どの作業にどの LLM を使用するか?不確実な評価の下での予算モデルの割り当て
Which LLM for Which Work? Budgeted Model Allocation under Uncertain Evaluation
改善を装った混乱:129,000人の患者登録における脳卒中抗血栓治療のためのオフライン強化学習の系統的評価
Confounding Masquerading as Improvement: A Systematic Evaluation of Offline Reinforcement Learning for Stroke Antithrombotic Treatment in a 129,000-Patient Registry
AI インサイトこの研究では、129,000件の脳卒中患者登録データを体系的に評価した結果、医師の意思決定に対するオフライン強化学習の見かけの改善(+0.0069から+0.0101)は、真の有効性の改善ではなく、主に報酬の埋め込み交絡によるものであることが判明した。これは、オフラインの RL 医療戦略に関するこれまでの肯定的な結論を再検討する必要があることを意味します。重要度 82/100マーチンゲールの発射が止まらないとき: 実際の予測ストリームに対するいつでも有効なゲーティング
When the Martingale Never Stops Firing: Anytime-Valid Gating on Real Forecast Streams
AI インサイトこの論文では、等角テスト マーチンゲールはリアルタイム予測ストリームの変化検出ツールとして機能し、いつでも有効なその誤検出保証はストリームが交換可能な場合にのみ適用されることを指摘しています。実際の展開では、データとモニタリングに依存して学習者を変更するというサイクルによって保証が無効になります。これは、理論とエンジニアリングの実装の間に重大なギャップがあることを意味します。重要度 60/100ランダムなオブジェクトを使用したフレシェ回帰の周辺座標検定
Marginal Coordinate Test for Fr\'echet Regression with Random Objects
AI インサイトこの論文では、半教師ありフレームワークとカーネル条件付き平均依存 U 統計を使用して、応答残差を必要とせずに予測子の増分情報をテストする、分離可能な計量空間におけるランダム オブジェクト回帰のエッジ座標テストを提案します。応答残差に依存した以前のテストと比較して、この方法では仮定が緩和され、適用範囲が拡大します。重要度 70/100インタラクティブ エージェント向けの選択認識型ストレス テスト
Selection-Aware Stress Testing for Interactive Agents
AI インサイトこの論文では、ワークフローとタスク タイプの選択を発見/確認の 2 つのフェーズに分離し、同じデータに対する結論を同時にスクリーニングすることを避ける、Selection-Aware Semantic Stress Testing (SASST) を提案します。 40 件のクラスター監査では、ガウス カバレッジが不十分であることが判明しました。タウベンチの 480 エピソード実験では、確認段階で優位性が消失することが 3.75 ポイント判明しました。これは、これまでのほとんどのエージェントレビューの「有利な結論」は選択バイアスによるものである可能性があり、評価パラダイムを単一のベンチマーク検索から共同検証に移行する必要があることを意味します。重要度 70/100いつから埋め込みスペースで作業できるのでしょうか?テキスト埋め込みが保持するもの
When Can We Work in Embedding Space? What Text Embeddings Preserve
学習されたマルチスケール サンプリングにより、ストレスを抱えたスピン システムにおける重大な速度低下を克服する
Overcoming critical slowing down in frustrated spin systems by learned multiscale sampling
AI インサイトこの研究では、WCRG 法を使用して、フラストレートしたソフト スピン モデルの集合的な変動条件分布を学習し、粗いものから細かいものまで再帰的にサンプリングし、弱いフラストレーションの下で失敗するクラスター アルゴリズムの制限を回避します。以前の構造クラスタリング アルゴリズムと比較して、関連するクラスターを生成するために構築が学習に置き換えられるのはこれが初めてです。重要度 68/100アフィン潜在パラメータ化を使用したニューラル ネットワークのシャープな近似レート
Sharp Approximation Rates for Neural Networks with Affine Latent Parameterizations
AI インサイトこの論文では、低次元の潜在表現から大規模なネットワーク パラメーターを生成するためのパラメーター効率の高い方法を研究し、アフィン潜在パラメーター化の下で鋭い近似率を提供します。このタイプの手法の経験的パフォーマンスに焦点を当てた前回の内容と比較して、今回は厳密な数学的保証を提供し、このタイプのフレームワークが理論的に明確な近似機能を備えていることを示しています。これは、ハイパーネットワーキングなどの方法が実用的であるだけでなく、その効率性が理論によっても裏付けられていることを意味します。重要度 72/100関連エンティティarXivネットワークを介したディープ グラフ カーネル ポイント プロセス
Deep graph kernel point processes over networks
AI インサイトこの論文は、ホークス インフルエンス カーネルの点プロセス モデルをパラメータ化するためにグラフ ニューラル ネットワークを使用することを提案します。ニューラル ネットワークを直接使用して状態強度をモデル化する場合と比較して、グラフ構造を使用してイベント間のネットワーク依存関係を明示的に把握できます。これは、ソーシャル ネットワークやトラフィックなどの構造化された離散イベントをモデル化する際に、モデルが GNN の表現能力とカーネル関数の解釈可能性を同時に取得でき、ディープ ポイント プロセスに新しい構造事前分布を提供できることを意味します。重要度 60/100PQMass: 確率質量推定を使用した生成モデルの品質の確率的評価
PQMass: Probabilistic Assessment of the Quality of Generative Models using Probability Mass Estimation
1次元混合ガウスモデルのモデル選択とパラメータ推定
Model Selection and Parameter Estimation of One-Dimensional Gaussian Mixture Models
AI インサイトこの論文は、一次元ガウス混合モデルのモデル次数推定のための最適なサンプル複雑さの下限を初めて証明し、フーリエに基づく推定方法を提供します。ヒューリスティックまたはベイジアン情報基準に依存する以前のアプローチと比較して、この研究はサンプル要件、成分の平均分離、および成分の総数の間の関係を理論的に明らかにしています。これは、モデル選択問題には検証可能な理論的保証があるものの、実際のアプリケーションについては計算上の実現可能性を検証する必要があることを意味します。重要度 65/100関数空間のオートエンコーダ
Autoencoders in Function Space
大規模なグラフィカル モデルの限界に対する Stein の方法
Stein's method for marginals on large graphical models
AIと人間のハイブリッドテキストにおける透かし比率の最適推定
Optimal Estimation of Watermark Proportions in Hybrid AI-Human Texts
AI インサイトこの研究は、LLM 透かし検出を「記事全体に透かしが入っているかどうか」という 2 値分類から混合テキスト内の透かしの割合の連続推定まで拡張した最初の研究であり、部分透かしスキームでは割合が識別できないことを証明しました。これは、混合シナリオでは既存の透かし検出には理論上の限界があり、識別可能な統計またはソリューションを設計する必要があることを意味します。重要度 72/100ベルマン完全性を持たないソフトフィット Q 反復: 占有再重み付けと温度アニーリング
Soft Fitted Q-Iteration without Bellman Completeness: Occupancy Reweighting and Temperature Annealing
AI インサイトこの論文では、占有重み付けと温度アニーリングを組み合わせたソフト FQI 法が、ベルマン完全性の仮定がなくても収束できることを提案します。関数クラスの閉包に依存する従来の FQI と比較して、新しい方法では、割引占有ノルムの下でのソフト最適戦略の縮小を使用して、仮定を緩和します。これは、オフライン強化学習の安定条件が関数近似のもとで満たされやすいことを意味します。重要度 65/100関連エンティティarXiv