🤖 AI 速览
📋 文章元数据
- 发布时间
- 2026-07-16
- 类型
- ai-daily
- 字数
- 2493
- 阅读时长
- 12 min
2026-07-16 AI日更 | AI 竞争进入安全底座:GPT-Red 上线,治理框架同步升温 链接到标题
今天的重点从“能力”转向“可控性”:OpenAI 一边推动州与联邦层面的 AI 治理基线,一边发布自动化红队 GPT-Red,说明安全评测正加速工程化。与此同时,AI 编程工具的数据与权限风险再次被放大,落地前提不再只是性能,而是边界、审计与信任。
📖 本期 Watch List 深度导读 链接到标题
今天最值得追的是“安全与可解释性”这条线:OpenAI 一边谈美国州与联邦层面的 AI 治理基线,一边发布 GPT-Red,用自动化红队扩展漏洞发现;配合 Claude 机制解释相关内容,适合安全、平台团队系统阅读。
第二条是“模型进入专业场景后的可靠性”。CANDI-QA、G-SHARE、盲文能力评测、虚假信息传播检测等论文都指向同一个问题:通用能力不等于可部署能力,医疗、金融、人因诊断、无障碍等场景需要更细粒度的上下文对齐与评测。
第三条关注“效率与工程化”:RAG reranking 蒸馏、文本数据集蒸馏、提示优化稳定性、时间点语言模型,都是在回答成本、时效与可信回测问题。另可补听 Intel 前 CEO 复盘与 Lovable 的 Vibe Coding 访谈,观察产业侧对 AI 编程和大厂转型的真实判断。
🌐 X 平台 AI 热点快讯 链接到标题
话题 1:DeepMind CEO Predicts AGI in Few Years, Proposes Safety Body 链接到标题
- 分类:AI · News
- 概况:热度时间:1 day ago,相关帖子数:50000
- 是什么事:DeepMind CEO 公开预测 AGI 可能在未来几年内出现,并提议设立专门的安全机构来监督相关风险。
- 为什么重要:这反映出顶级 AI 机构对 AGI 时间表的判断正在趋近现实讨论,也把“能力推进”与“治理和安全”同时推到行业核心议程。
- 讨论概况:X 上主要在讨论 AGI 时间表是否过于乐观、DeepMind 这类公司是否应主导安全规则,以及“安全机构”是实际治理方案还是公关表态;支持者强调提前布局,质疑者则担心能力竞赛会快于监管。
话题 2:Security Researcher Exposes Grok Build’s Unintended Repo Uploads 链接到标题
- 分类:AI · News
- 概况:热度时间:1 day ago,相关帖子数:8300
- 是什么事:一名安全研究人员称,xAI 的 Grok Build 功能可能在用户不知情的情况下上传代码仓库内容,引发数据泄露担忧。
- 为什么重要:该事件凸显 AI 编程与构建工具在访问本地代码、处理私有仓库和权限边界方面的安全风险,可能影响企业对 AI 开发工具的信任与采用。
- 讨论概况:X 上的讨论集中在这是否属于严重安全漏洞、用户授权提示是否充分、xAI 的责任与响应速度,以及 AI 工具在便利性和隐私保护之间应如何平衡。
话题 3:Booster Robotics Unveils T2 Humanoid for AI Developers 链接到标题
- 分类:AI · News
- 概况:热度时间:13 hours ago,相关帖子数:512
- 是什么事:Booster Robotics 发布面向 AI 开发者的 T2 人形机器人平台,主打用于具身智能、机器人控制与应用开发。
- 为什么重要:该产品为 AI 模型从虚拟环境走向真实物理世界提供硬件载体,有助于推动具身智能、机器人学习和人机交互应用落地。
- 讨论概况:X 上的讨论主要集中在 T2 的开放性、价格、开发者友好程度、运动能力与量产可行性;也有人质疑其与特斯拉 Optimus、Figure 等人形机器人相比是否具备差异化优势。
今日 X 上的 AI 舆情小结 链接到标题
今天的舆论主线是,AI 正同时从“更强模型”走向“现实部署”:一边是 AGI 时间表被顶级机构推近,安全治理被迫进入核心议程;另一边是 AI 编程工具和人形机器人开始触及真实代码资产与物理世界。共识在于,行业已不能只讨论能力提升,权限边界、数据安全、监管机制和落地可靠性都必须同步设计。分歧主要集中在谁有资格制定安全规则、AGI 预测是否过度乐观,以及新硬件平台究竟是具身智能的重要入口还是又一次概念先行。潜在风险则在于,能力竞赛可能快于治理落地,开发工具可能在便利性包装下扩大数据泄露面,而机器人平台若过早商业化,也可能把软件不确定性带入现实环境。
💡 大佬观点(Influencer Insights) 链接到标题
AI 行业脉动日报:基于 X 平台大佬洞察 链接到标题
以下是基于过去 24 小时内 AI 领域关键意见领袖在 X 平台动态的深度分析。
1. 核心趋势:AI 编程进入“工作流自动化”深水区 链接到标题
今日最显著的共同关注点不是新模型的发布,而是 AI Agent 技能与工作流的生态化、实用化。大佬们正在从“模型能做啥”的尝鲜,转向“如何让模型稳定、高效地帮我干活”。
Agent Skill 生态爆发:多位博主不约而同地聚焦于 Skill 的创建、分享与商业化。
- @dotey 详细分享了他开发
BaoCut(视频翻译剪辑 Skill)的心路历程,并强调了 Agent + Skill + CLI + GUI 这一混合工作流的最佳实践。他还展示了个人从“设计 -> 原型 -> 编码 -> 发布”的全流程 AI 化闭环。 - @Pluvio9yte 接力分享,发布了解析微信公众号文章的 Skill(
rn-wechat-extract),解决了 Agent 访问特定生态内容时的“最后一公里”问题。他还推荐了为 AI Agent 设计的搜索基础设施AnySearch,指出传统搜索返回摘要、Agent 需要二次解析的痛点。 - @ruanyf 敏锐地观察到 小红书正试图构建 Skill 生态(
REDSkill),将社交媒体平台与 Skill Hub 结合,这被视为为社区 AI 化转型打基础,对开发者而言是接触海量用户的新渠道。 - @vista8 也发布了自己的 GIF 压缩 Skill。
- 分析师洞察:这说明 AI 编程的竞争已从模型能力层面,上升到围绕 Agent 平台的工具链、插件生态和工作流集成能力的竞争。开发者们正在将零散的 AI 能力封装为可复用、可分享、面向真实任务的 Skill,这正是 Agent 从“玩具”走向“生产力工具”的关键一步。
- @dotey 详细分享了他开发
Codex 与 Claude Code 的路线之争:
- @dotey 持续关注 Codex 动态,提到其用户数已达 800 万,并集成了 GPT-5.6、Ultra 多智能体模式、Cloudflare 一键发布等完整工作流。他提到 GPT 5.6 Sol 在 Agent 竞技场排名第二,逼近 Claude Fable 5。
- @zhixianio 则在真实场景中深度体验 Claude Fable 5,对其震撼的代码能力(40 分钟完成 70% 工作并自主优化设计)印象深刻,认为其改变了开发范式。
- 分析师洞察:市场形成了两大阵营:OpenAI 的 Codex 通过 Workspace 集成和生态扩展 来吸引用户;Anthropic 的 Claude Code (Fable 5) 则凭借 顶级的单任务推理与代码生成质量 赢得口碑。用户(如 @dotey)开始形成自己的搭配心法:设计 UI 用 Opus/Fable,实现逻辑用 GPT 5.6 Sol。
2. 独特观点与行业前瞻 链接到标题
“知识付费”与“AI 取代论”的持续博弈:
- @gefei55 深刻反思社群运营与知识付费的价值,反驳其无用论。他认为在 AI 时代,花钱向有经验的人学习,省下的是宝贵的时间成本,这是一种必要的投资。
- 他同时警示程序员群体:AI 提高了生产效率,但如果不做需求调研和产品推广,只会从“一月写一个没人用的 App”变成“一月花一万块钱 Token 写 37 个没人用的 App”,精准点出了“Vibe Coding”的陷阱,强调人类在需求验证、营销等环节的不可替代性。
对模型能力的深度思辨:
- @zhixianio 对端侧模型 Gemma 4 12B Coder 的深度测评极具参考价值。他指出该模型在简单任务上与 35B 模型持平,但在复杂、长链条任务(如生成完整俄罗斯方块)上会因 参数量天花板 而崩溃。这一观点精确地定义了不同规模模型的能力边界。
- @Pluvio9yte 强力推荐腾讯的 Hy3 模型,认为其在前端开发、美学设计和内容编排的综合能力上具有跨代优势,能在 8 分钟内生成媲美专业设计师数天工作成果的网站,输出质量在需求贴合度和可玩性上非常突出。
- @vista8 提出一个值得关注的合规性问题:为何许多国产模型 API 不再允许自定义
temperature参数? 他猜测可能与 蒸馏 技术有关,这指向了行业在模型部署时可能隐含的技术限制。
关于人与 AI 关系的哲学思考:
- @vista8 引用 IBM 1979 年的名言:“计算机永远不能被追究责任,因此绝不能做出管理决策”。他强调未来真正稀缺的是 能发现真问题、在信息不足时做判断并为后果负责的人,这与 @gefei55 的观点形成共振。
- @lijigang 指出,长期使用某款模型,你的语言风格会沾染上它的“味道”,因为人脑神经网络非常“吃”语境。他提醒人们要警惕被模型塑造,像精选书籍一样去精选自己的信息输入,保持思维的“异质性”。
3. 推荐的工具与资源 链接到标题
AI Agent 工作流类:
AnySearch(@Pluvio9yte 推荐):一个为 AI Agent 设计的搜索基础设施,能将网页转为结构化 Markdown,解决传统搜索只给链接的痛点。rn-wechat-extractSkill (@Pluvio9yte 开源):让 Agent 能绕过微信限制,直接下载并解析公众号文章内容。REDSkill(@ruanyf 观察):小红书官方 Skill 平台,可用于托管和传播你的 Agent Skill,接触海量用户。BaoCutSkill (@dotey 出品):配合 Agent 实现视频转录、润色(去口癖)、翻译、剪辑的全流程。qiaomu-tiny-gifSkill (@vista8 开源):专为满足公众号 10M 大小及帧数限制而生的 GIF 压缩工具。
设计与前端资源:
- Vibe Coding 设计名词网站 (@vista8 推荐):一个整理了 Web/App 常见组件、动效和设计风格(如 Liquid Glass, Neumorphism)名字的网站,帮你准确向 AI 描述设计需求,提升 Vibe Coding 的质量。
值得关注的模型:
- 腾讯混元 Hy3 模型 (@Pluvio9yte @ruanyf 联合推荐):API 定价约为输入 $0.15 / 输出 $0.59 每百万 token,在前端开发、设计、Agent 任务上表现出色,社区测试反馈优于多款参数量更大的模型,综合性价比极高。
- 端侧模型 Gemma 4 + Gemma 4 Coder (@zhixianio 深度测试):适合本地部署,小任务效率高,但不适合“一次成型”的复杂程序生成。Google 的 QAT (量化感知训练) 版本是端侧部署的重要优化方向。
📚 附录:今日 Watch List 更新源列表 链接到标题
时间窗口:最近 3 天;覆盖 22 个源;共 25 条更新
All-In Podcast (A_full) 链接到标题
- Former Intel CEO on What Went Wrong, What’s Next + Lovable CEO on the Real Promise of Vibe Coding
- 发布时间:2026-07-16 04:55 北京时间
- 摘要:- Airwallex 是一家面向现代企业的全球领先支付和金融平台,提供值得信赖的解决方案来管理从企业账户、支付、财务和支出管理到嵌入式金融的一切事务。
- Plaud - 如果您的工作依赖于对话(会议、交易流程、访谈、客户电话),Plaud 可以帮助您通过高度准确的 AI 生成的笔记来捕获和组织所有内容,这些笔记不仅仅是简单的摘要,还可以突出显示痛点、关键决策、后续步骤和可自定义的摘要模板。
- 查看 Plaud 并使用代码 ALLIN 享受高达 20% 的折扣!
- 亚马逊上也有售:(代码:ALLIN20X)。
- 特别感谢 Raise Summit 在巴黎接待我们。
- EN 要点:
- (0:00) Former Intel CEO Pat Gelsinger joins Jason
- (1:41) What Went Wrong at Intel
- (15:19) Why a Taiwan Blockade Would Cripple the US Economy
- (25:00) Lovable’s Anton Osika: One Million New Apps a Week
Stratechery by Ben Thompson (A_full) 链接到标题
- IBM Misses, IBM’s Mainframe Moat, IBM’s Many AI Problems
- 发布时间:2026-07-15 18:00 北京时间
- 摘要:- IBM公布的初步结果令软件市场普遍感到恐慌;然而,这是一个专门关于 IBM 及其大型机专营权的故事。
- 15 美元/月或150 美元/年。
- 通过每周三封电子邮件或播客对当天新闻进行实质性分析。
- 策略采访。
- 采访领先的上市首席执行官、私营公司创始人,并与分析师同行进行讨论。
- EN 要点:
- IBM announced preliminary results that spooked the software market generally; this is a story, however, specifically about IBM and its mainframe franchise.
OpenAI Blog (A_full) 链接到标题
The US is advancing AI safety through state and federal action
- 发布时间:2026-07-15 20:00 北京时间
- 摘要:- 作者:Chris Lehane,首席全球事务官。
- 从全国各州首府到华盛顿,再到国际会议,前沿人工智能治理的严肃方法正在形成。
- 他们正在共同推进人工智能的民主愿景。
- 加利福尼亚州、纽约州和最近的伊利诺伊州制定了先进的边境安全立法,帮助该国朝着管理最强大的人工智能系统的共同基线迈进。
- 这些努力反映了 OpenAI 所谓的反向联邦制背后的动力:各州通过共同框架帮助建立共同方向。
- EN 要点:
- OpenAI outlines a “reverse federalism” approach to AI governance, where state laws help build a national framework for safe, democratic AI.
GPT-Red: Unlocking Self-Improvement for Robustness
- 发布时间:2026-07-15 18:00 北京时间
- 摘要:- * 红队对于发现漏洞和提高模型的稳健性至关重要。
- 然而,当前的方法不可扩展,从而产生了瓶颈。
- 常用的稳健性评估已经被我们的最新模型饱和。
- 我们需要开发允许安全性和一致性与模型功能一起扩展的方法。
- 我们训练了 GPT‑Red,这是一种自动化的红队模型,可以扩展我们发现漏洞的能力,以便我们可以在更广泛的部署之前修复它们。
- EN 要点:
- Explore GPT-Red, OpenAI’s automated red teaming system that uses self-play to improve AI safety, alignment, and prompt injection robustness.
Two Minute Papers (B_intro+search) 链接到标题
- Claude’s Brain Has A Secret… And Scientists Found It
- 发布时间:2026-07-15 21:58 北京时间
- 摘要:- ❤️ 在这里查看 Lambda 并注册他们的 GPU Cloud:。
- 📝 该论文可在此处获取:.
- 驯鹿视力改变的论文 -。
- Adam Bridges、Benji Rabhan、B Shang、Cameron Navor、Charles Ian Norman Venn、Christian Ahlin、Eric T、Fred R、Gordon Child、Juan Benet、Michael Tedder、Owen Skarpness、Richard Sundvall、Ryan Stankye、Shawn Becker、Steef、Taras Bobrovytsky、Tazaur Sagenclaw、Tybie Fitzhugh、Ueli Gallizzi。
- EN 要点:
- ❤️ Check out Lambda here and sign up for their GPU Cloud:
- 📝 The paper is available here:
- Paper for reindeer vision change -
- 🙏 We would like to thank our generous Patreon supporters who make Two Minute Papers possible:
ArXiv cs.CL (B_intro+search) 链接到标题
Scaling Point-in-Time Language Models
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11889v1 公告类型:新。
- 摘要:在不受限制的互联网语料库上训练的大型语言模型不可避免地嵌入了来自未来的信息,从而引入了前瞻偏差,从而损害了金融和社会科学中回溯测试和因果推理的有效性。
- 时间点语言模型(专门针对每个日历日期之前可用的文本进行训练)通过构建消除了这种泄漏,但现有的努力通常产生的模型大大落后于不受约束的对应模型。
- 我们证明这种性能差距可以通过规模来大幅缩小。
- EN 要点:
- arXiv:2607.11889v1 Announce Type: new
- Abstract: Large language models trained on unrestricted internet corpora inevitably embed information from the future, introducing lookahead bias that compromis…
- Point-in-time language models–trained exclusively on text available up to each calendar date–eliminate this leakage by construction, but existing efforts typi…
- We show that this performance gap can be substantially narrowed through scale
CANDI: Contextual Alignment for Niche Domains Question Answering
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11891v1 公告类型:新。
- 摘要:在医疗诊断和财务咨询等专业领域部署大型语言模型 (LLM) 需要评估超出一般知识的能力。
- 传统的问答基准通常无法捕捉这些领域所需的细致入微的上下文基础、用户意识和领域理解。
- 为了解决这个问题,我们引入了 CANDI-QA(利基领域问答的上下文对齐),这是一个新颖的数据集,用于评估法学硕士在专业环境中提供准确、上下文敏感和用户对齐的答案。
- EN 要点:
- arXiv:2607.11891v1 Announce Type: new
- Abstract: The deployment of large language models (LLMs) in specialized domains like medical diagnostics and financial advisory necessitates evaluating capabili…
- Traditional question-answering benchmarks often fail to capture the nuanced contextual grounding, user awareness, and domain understanding these fields require
- To address this, we introduce CANDI-QA (Contextual Alignment for Niche Domains Question Answering), a novel dataset evaluating LLMs on delivering accurate, cont…
G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event Diagnosis
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11892v1 公告类型:新。
- 摘要:人因事件诊断对于从核电厂的运行事件中学习至关重要,但其质量在很大程度上取决于专家对叙述性报告的解释和基于指南的推理。现有的数据驱动或一次性大语言模型方法通常缺乏结构化推理,与正式诊断指南的一致性有限,并且可能产生逻辑上不一致的结论。
- 为了解决这个问题,本研究提出了G-SHARE,一种基于指南的结构化推理框架,将CNNP九步人因事件诊断指南操作为多阶段诊断流程。该框架由证据提取、逐步诊断推理和事后一致性修复组成,能够显式使用报告证据、中间理由生成和诊断输出的逻辑验证。
- 根据中国核工业来源构建了真实人为事件报告的数据集,并使用由领域专家注释的黄金标准子集进行评估。
- EN 要点:
- arXiv:2607.11892v1 Announce Type: new
- Abstract: Human-factor event diagnosis is essential for learning from operational events in nuclear power plants, yet its quality depends strongly on expert int…
- To address this issue, this study proposes G-SHARE, a guideline-based structured reasoning framework that operationalizes the CNNP nine-step human-factor event…
- A dataset of real human-factor event reports was constructed from Chinese nuclear industry sources, and a gold-standard subset annotated by domain experts was u…
I’m Sorry, but I Can’t Help with Braille: Revealing Accessibility Failures in State-of-the-Art LLMs
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11893v1 公告类型:新。
- 摘要:大型语言模型(LLM)在许多语言任务上表现强劲,但它们在结构受限、可访问性关键的模式(例如盲文)中的能力仍不清楚。
- 我们使用人工注释的数据集评估最先进的韩语盲文双向翻译法学硕士。
- 尽管期望多语言、指令调整的模型可以通过文本表示推广到盲文,但我们发现输出始终很差、不稳定,并且与人类判断存在很大差异。
- EN 要点:
- arXiv:2607.11893v1 Announce Type: new
- Abstract: Large Language Models (LLMs) perform strongly on many language tasks, but their capability in structurally constrained, accessibility-critical modalit…
- We evaluate state-of-the-art LLMs on bidirectional Korean-Braille translation using a human-annotated dataset
- Despite expectations that multilingual, instruction-tuned models can generalize to Braille via text representations, we find consistently poor, unstable outputs…
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11894v1 公告类型:新。
- 摘要:由于在线内容的规模扩大、快速演变和语言变异,检测社交媒体上的虚假信息叙述具有挑战性。
- 我们提出了一个基于图的框架,通过将弱监督与传播图分析相结合来识别和分析 Telegram 生态系统中的虚假信息叙述。
- 该方法将语义相关的主张聚合到叙述级集群中,并对其在互连渠道中的扩散进行建模。
- EN 要点:
- arXiv:2607.11894v1 Announce Type: new
- Abstract: Detecting disinformation narratives on social media is challenging due to the scale of amplification, rapid evolution, and linguistic variability of o…
- We propose a graph-based framework for identifying and analyzing disinformation narratives in Telegram ecosystems by combining weak supervision with propagation…
- The approach aggregates semantically related claims into narrative-level clusters and models their diffusion across interconnected channels
TAKE: Trajectory-Aware Knowledge Estimation for Text Dataset Distillation
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11898v1 公告类型:新。
- 摘要:大规模文本语料库已成为现代 NLP 的一个安静瓶颈,不仅在存储方面,而且在训练、微调和持续学习的累积成本方面。
- 我们提出了一个文本数据集蒸馏框架,可将语料库减少至原始大小的 0.1%,同时保持下游任务保真度。
- 我们通过影响函数的视角进行蒸馏,它量化每个样本对下游目标的贡献,这是选择的自然和原则基础。
- EN 要点:
- arXiv:2607.11898v1 Announce Type: new
- Abstract: Large-scale text corpora have become a quiet bottleneck in modern NLP, not just in storage, but in the accumulated cost of training, fine-tuning, and…
- We propose a text dataset distillation framework that reduces corpora to as little as 0.1% of their original size while preserving downstream task fidelity
- We approach distillation through the lens of influence functions, which quantify each sample’s contribution to the downstream objective, a natural and principle…
Transforming LLMs into Efficient Cross-Encoders via Knowledge Distillation for RAG Reranking
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11933v1 公告类型:新。
-摘要:交叉编码器在检索增强生成(RAG)管道中实现了较高的重新排序精度,但会带来限制实时部署的二次推理成本。
- 我们通过使用两阶段管道将 LLaMA 3 (8B) 微调为嵌入式重排序器来解决这个问题:通过 Unsloth 框架和 LoRA 适配器对自定义查询文档相关性数据集进行监督微调,然后进行 4 位量化以实现高效推理。
- 生成的模型取代了结合 BM25 和密集向量搜索的双检索器 RAG 管道中的交叉编码器。
- EN 要点:
- arXiv:2607.11933v1 Announce Type: new
- Abstract: Cross-encoders achieve high reranking accuracy in Retrieval-Augmented Generation (RAG) pipelines but impose quadratic inference costs that limit real-…
- We address this by fine-tuning LLaMA 3 (8B) as a drop-in reranker using a two-stage pipeline: supervised fine-tuning on a custom query-document relevance datase…
- The resulting model replaces the cross-encoder in a dual-retriever RAG pipeline combining BM25 and dense vector search
MAGE: Understanding Stability-Performance Trade-offs in Multi-component Prompt Optimization
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11944v1 公告类型:新。
- 摘要:迭代提示优化的不同组成部分如何相互作用,以及它们组合时会发生什么?
- 我们通过 MAGE(记忆增强目标导向提示进化)对此进行研究,这是一个用于研究提示优化中组件交互的受控分析框架。
- MAGE 并不是绝对意义上的高级优化器;它集成了情景记忆、多目标帕累托选择和自适应评估作为受控消融的平台。
- EN 要点:
- arXiv:2607.11944v1 Announce Type: new
- Abstract: How do different components of iterative prompt optimization interact, and what happens when they are combined
- We investigate this through MAGE (Memory-Augmented Goal-directed Prompt Evolution), a controlled analysis framework for studying component interaction in prompt…
- MAGE is not proposed as a superior optimizer in absolute terms; it integrates episodic memory, multi-objective Pareto selection, and adaptive evaluation as a pl…
Belief-reality separation lives in routing over a shared value slot in language models
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11945v1 公告类型:新。
- 摘要:有能力的语言模型将角色的信念与事实分开:告诉“安娜相信杯子是蓝色的;实际上它是红色的”,他们对安娜的回答是蓝色,对世界的回答是红色。
- 这种分离在计算中位于什么位置?
- 我们展示它位于两个位置的两个可分离机构上。
- EN 要点:
- arXiv:2607.11945v1 Announce Type: new
- Abstract: Capable language models hold what a character believes apart from what is true: told “Anna believes the cup is blue; in reality it is red,” they answe…
- Where in the computation does that separation live
- We show it rests on two separable mechanisms at two positions
Hybrid Continual Learning for Low-Resource Australian Aboriginal Language Identification
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11946v1 公告类型:新。
- 摘要:语言识别是将濒临灭绝的澳大利亚原住民语言 (AAL) 整合到支持语言复兴和数字包容的语音技术中的重要一步。
- 然而,数据的极度稀缺限制了模型的性能。
- 从高资源语言进行迁移学习显示出前景,但在适应新语言时常常会遭受灾难性遗忘。
- EN 要点:
- arXiv:2607.11946v1 Announce Type: new
- Abstract: Language identification is an important step toward integrating endangered Australian Aboriginal languages (AALs) into speech technologies supporting…
- However, extreme data scarcity limits model performance
- Transfer learning from high-resource languages shows promise but often suffers from catastrophic forgetting when adapting to new languages
ArXiv cs.LG (B_intro+search) 链接到标题
OmniPMNet: Bridging discrete and gridded PM10 forecasts via omni-query neural processes
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11896v1 公告类型:新。
- 摘要:预测颗粒物 (PM10) 需要站级精度和连续空间场,特别是在严重沙尘暴期间。
- 化学品运输模型 (CTM) 提供网格预测,但保留局部偏差,而图神经网络 (GNN) 在短时间内很好地跟踪监测站点,但不产生网格输出。
- 在这里,我们提出了 OmniPM-Net,这是一种基于卷积条件神经过程 (ConvCNP) 的融合模型,可在共享空间表示中协调这两种预测类型。
- EN 要点:
- arXiv:2607.11896v1 Announce Type: new
- Abstract: Forecasting particulate matter (PM10) requires both station-scale accuracy and continuous spatial fields, especially during severe dust storms
- Chemical transport models (CTMs) provide gridded forecasts but retain local biases, whereas graph neural networks (GNNs) track monitoring sites well at short le…
- Here we present OmniPM-Net, a Convolutional Conditional Neural Process (ConvCNP)-based fusion model that reconciles these two forecast types within a shared spa…
Semidirect Fourier Delta Attention: Phase-Controlled Delta Memory with Constructive Chunk-WY Kernels
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11897v1 公告类型:新。
-摘要:线性注意力用固定的循环状态取代了softmax注意力不断增长的KV缓存,但这种压缩限制了精确的状态跟踪和长上下文记忆。
- 我们引入 \emph{Semidirect Fourier Delta Attention} (SFDA),它是 Kimi Delta Attention 的相控泛化,用块旋转傅里叶控制代替真正的对角线衰减: [ S_t=(I-\beta_t k_tk_t^)\Lambda_tS_{t-1}+\beta_tk_tv_t^, \qquad \Lambda_t=\diag(\alpha_t\odot e^{i\theta_t})。
- ] 我们的主要结果是对产品 (A_t=\Lambda_t-u_tr_t^) 进行建设性的 chunk-WY 分解,给出 [ A_t\cdots A_1=\Gamma_t-Y_tM_tW_t^ ] ,其排名增长限制在固定块内。
- EN 要点:
- arXiv:2607.11897v1 Announce Type: new
- Abstract: Linear attention replaces softmax attention’s growing KV cache with a fixed recurrent state, but this compression limits exact state tracking and long…
- We introduce \emph{Semidirect Fourier Delta Attention} (SFDA), a phase-controlled generalization of Kimi Delta Attention that replaces real diagonal decay with…
- ] Our main result is a constructive chunk-WY factorization for products (A_t=\Lambda_t-u_tr_t^), giving [ A_t\cdots A_1=\Gamma_t-Y_tM_tW_t^ ] with rank g…
Repairing Shape-Prior Shortcuts in Long-Range Single-Shot Fringe Projection Profilometry
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11928v1 公告类型:新。
- 摘要:直接回归深度的单次条纹投影轮廓测量(FPP)网络可以利用形状先验的捷径,从对象边界而不是从条纹相位恢复深度。
- 在真实感合成基准(15,600 个条纹图像,1.5-2.1 m 距离处的 50 个物体)上,14.54 mm 物体平均绝对误差 (MAE) 处的最佳 UNet 基线平台,更多的数据和更多的容量都不会消除捷径,因为两者都不会改变优化器搜索的假设空间。
- 我们引入了 PhiCalNet,它输出一个包裹相位表示 $(\sin\phi, \cos\phi)$ 并通过固定的可微校准层将其映射到深度,从架构上消除形状先验解决方案,而不是通过损失惩罚。
- EN 要点:
- arXiv:2607.11928v1 Announce Type: new
- Abstract: Single-shot fringe projection profilometry (FPP) networks that regress depth directly can exploit a shape-prior shortcut, recovering depth from object…
- On a photorealistic synthetic benchmark (15,600 fringe images, 50 objects at 1.5-2.1 m standoff), the best such UNet baseline plateaus at 14.54 mm object mean a…
- We introduce PhiCalNet, which outputs a wrapped-phase representation $(\sin\phi, \cos\phi)$ and maps it to depth through a fixed differentiable calibration laye…
Qubit-Efficient Quantum Search for Hyperdimensional Decomposition via Logarithmic Encoding
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11936v1 公告类型:新。
- 摘要:超维计算 (HDC) 使用维度 $D$ 的高维超向量表示符号。
- 在超向量分解中,目标是从绑定的目标超向量中恢复 $F$ 个组成超向量,每个超向量都从大小为 $N$ 的码本中提取。
- 这需要搜索 $N^F$ 个候选元组,使得该任务在大规模计算上难以实现。
- EN 要点:
- arXiv:2607.11936v1 Announce Type: new
- Abstract: Hyperdimensional Computing (HDC) represents symbols using high-dimensional hypervectors of dimension $D$
- In hypervector decomposition, the objective is to recover $F$ constituent hypervectors, each drawn from a codebook of size $N$, from a bound target hypervector
- This requires searching over $N^F$ candidate tuples, making the task computationally prohibitive at scale
Mirror Horizon: Viable Path Entropy as a Measure of Bounded Reflection
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11937v1 公告类型:新。
- 摘要:镜像理论提出,研究一个智能系统不仅要研究它所代表的内容,还要研究它在反复反射下能够维持哪些连贯的延续。
- 我们通过\emph{可行路径熵}(VPE)使这一主张发挥作用,这是一种经过验证的连续能力的有限预算衡量标准。
- 给定镜像状态、推出协议、验证者和模式映射,VPE 将有界能力分解为两部分:达到可行延续的概率和成功推出中达到的已验证延续模式的多样性。
- EN 要点:
- arXiv:2607.11937v1 Announce Type: new
- Abstract: Mirror Theory proposes that an intelligent system should be studied not only by what it represents, but by what coherent continuations it can sustain…
- We make this claim operational through \emph{viable path entropy} (VPE), a finite-budget measure of verified continuation capacity
- Given a mirror state, a rollout protocol, a verifier, and a mode map, VPE decomposes bounded capability into two parts: the probability of reaching a viable con…
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11938v1 公告类型:新。
- 摘要:这本书是关于数据科学的数学基础的。
- 高维度的诅咒、祝福和惊喜。
- 奇异值分解和主成分分析。
- EN 要点:
- arXiv:2607.11938v1 Announce Type: new
- Abstract: This book is about the mathematical foundations of data science
- Introduction
- Curses, Blessings, and Surprises in High Dimensions
CARE-LoRA: Compressed Activation REconstruction for Memory-Efficient LoRA
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11940v1 公告类型:新。
-摘要:随着大型预训练模型的规模不断增长,在有限的内存预算下对其进行微调变得越来越具有挑战性。
- 低秩适应(LoRA)是目前最广泛采用的参数高效微调(PEFT)方法之一,它通过仅优化低秩适应矩阵来缓解这一挑战,从而大大减少可训练参数的数量。
- 随着参数开销的大幅减少,为反向传播保留的激活已成为 LoRA 微调期间的主要剩余内存瓶颈。
- EN 要点:
- arXiv:2607.11940v1 Announce Type: new
- Abstract: As the scale of large pre-trained models continues to grow, fine-tuning them under limited memory budgets has become increasingly challenging
- Low-Rank Adaptation (LoRA), currently one of the most widely adopted parameter-efficient fine-tuning (PEFT) methods, mitigates this challenge by optimizing only…
- With the parameter overhead substantially reduced, the activations retained for backpropagation have emerged as the primary remaining memory bottleneck during L…
How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11942v1 公告类型:新。
- 摘要:KV 缓存压缩方法主要通过压缩前附加到上下文的查询来评估——一种查询感知协议。
- 然而,压缩 KV 缓存的经济案例是重用:压缩文档一次,就可以回答许多未来针对它的问题。
- 在该部署中,压缩必须与查询无关——在出现任何问题之前。
- EN 要点:
- arXiv:2607.11942v1 Announce Type: new
- Abstract: KV-cache compression methods are predominantly evaluated with the query appended to the context before compression – a query-aware protocol
- Yet the economic case for a compressed KV cache is reuse: compress a document once, answer many future questions against it
- In that deployment, compression must happen query-agnostic – before any question is seen
BattVAE-GP: Generative Modeling of Long-Horizon Battery Degradation with Uncertainty Quantification
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11943v1 公告类型:新。
-摘要:基于物理的长视野电池退化模拟提供了机制洞察,但计算成本仍然很高,限制了它们在延长循环寿命期间对操作条件进行密集探索的使用。
- 在这里,我们提出了一种混合物理-概率学习框架,用于对未见充电速率下的锂离子电池退化轨迹进行代理建模。
- 使用 PyBaMM 中的 DFN/P2D 电化学模型生成的循环解析退化数据首先转换为容量对齐的电压和导数特征,并使用变分自动编码器 (VAE) 进行编码。
- EN 要点:
- arXiv:2607.11943v1 Announce Type: new
- Abstract: Long-horizon physics-based simulations of battery degradation provide mechanistic insight but remain computationally expensive, limiting their use for…
- Here, we propose a hybrid physics-probabilistic learning framework for surrogate modeling of lithium-ion battery degradation trajectories at unseen charging rat…
- Cycle-resolved degradation data generated with a DFN/P2D electrochemical model in PyBaMM are first transformed into capacity-aligned voltage and derivative feat…
Generalized Distribution-Free Semi-Supervised Learning with Risk Rewrite
- 发布时间:2026-07-15 12:00 北京时间
- 摘要:- arXiv:2607.11947v1 公告类型:新。
- 摘要:典型的半监督学习(SSL)方法依赖于分布假设,当违反这些假设时,它们的性能会下降。
- 虽然 PNU 学习(一种风险重写方法)提供了一种无分布的替代方案,但它仅限于二元分类,并且其方差最优性仍不清楚。
- 在本文中,我们提出了一个通用框架,该框架使用成分风险的线性组合构建无偏风险估计器,纳入 PNU 学习并扩展到多类分类。
- EN 要点:
- arXiv:2607.11947v1 Announce Type: new
- Abstract: Typical semi-supervised learning (SSL) methods rely on distributional assumptions, and their performance degrades when these are violated
- While PNU learning, a risk rewriting method, offers a distribution-free alternative, it is restricted to binary classification and its variance optimality remai…
- In this paper, we propose a generalized framework that constructs unbiased risk estimators using linear combinations of component risks, subsuming PNU learning…