📰 每日 AI 资讯

2026年08月01日

最后更新:2026-08-01 08:02:59 UTC+8

🔹 Hacker News

Golang提案:container/:通用集合类型

文章网址:https://github.com/golang/go/issues/80590 评论网址:https://news.ycombinator.com/item?id=49127031 积分:109 # 评论: 61

📅 Fri, 31 Jul 2026 🔗 原文链接

Tailscale 并没有阻止 Hugging Face 的入侵

文章网址:https://tailscale.com/blog/hugging-face-intrusion 评论网址:https://news.ycombinator.com/item?id=49127306 积分:358 # 评论: 147

📅 Fri, 31 Jul 2026 🔗 原文链接

用于突发 LLM 推理的预测推测 KV 复制

https://github.com/jwlaboratory/bite-the-bullet 评论网址:https://news.ycombinator.com/item?id=49127874 积分:17 # 评论: 1

📅 Fri, 31 Jul 2026 🔗 原文链接

揭秘 DRAM 读取干扰:RowHammer 和 RowPress 现象

文章网址:https://arxiv.org/abs/2607.28233 评论网址:https://news.ycombinator.com/item?id=49128323 积分:22 # 评论: 13

📅 Fri, 31 Jul 2026 🔗 原文链接

Loops (YC W22) 正在招聘一名产品教育者

文章网址:https://www.ycombinator.com/companies/loops/jobs/zqUnwqB-product-educator-technical-content-creator 评论网址:https://news.ycombinator.com/item?id=49128462 积分:0 # 评论: 0

📅 Fri, 31 Jul 2026 🔗 原文链接

🔹 arXiv 人工智能

GuideSkill:不断发展可执行的法学硕士代理技能,以实现基于指南的临床推理

arXiv:2607.26160v1 公告类型:新 摘要:临床实践指南(CPG)编码诊断标准,但法学硕士系统通常检索指南文本或通过培训吸收它,而不是执行其规则。我们引入了 GuideSkill,一个外部推理层,它将特定于疾病的标准编译成返回顺序诊断支持分数的可执行函数。引导技能-Z...

📅 Fri, 31 Jul 2026 🔗 原文链接

当基准推论不成立时:人工智能评估中的可预测性

arXiv:2607.26159v1 公告类型:新 摘要:人工智能基准测试结果很少能一步达到结果要求。评估人员将其推广到更多案例,将其解释为能力的证据,将其推断到新任务,将其传输到另一个系统或站点,并将其与有关人工审查和下游后果的假设相结合。以有效性为中心的方法需要证据...

📅 Fri, 31 Jul 2026 🔗 原文链接

ClinLens:面向纵向多模态临床数据科学的长视野编码剂

arXiv:2607.26155v1 公告类型:新 摘要:临床数据科学代理必须将异构纵向记录转换为可审计的分析,但现有基准在很大程度上隔离了医学问答、结构化表格推理或通用科学存储库。我们推出 CLINLENS,这是一个基准测试,涵盖 5 个链接的 MIMIC 资源上的 200 个可执行任务,涵盖结构化电子...

📅 Fri, 31 Jul 2026 🔗 原文链接

更多的欺骗:混合动机 LLM 多代理系统中的目标错位

arXiv:2607.26120v1 公告类型:新 摘要:大型语言模型(LLM)驱动的多智能体系统越来越多地部署在混合动机环境中,在这种环境中,智能体在信息不对称和由于目标冲突或隐藏而导致的战略欺骗下运行。在这些情况下,与集体目标不一致成为一个核心问题。我们提出了一个新的框架来评估...

📅 Fri, 31 Jul 2026 🔗 原文链接

探究推理性能的起源:RL 与 SFT 微调模型中解决数学问题的表征质量

arXiv:2607.26119v1 公告类型:新 摘要:通过强化学习(RL)训练的大型推理模型越来越多地被证明在数学推理任务上优于监督微调(SFT)模型;然而,这种优势的机制基础仍不清楚。因此我们要问,哪些内部表征差异使强化学习模型具有卓越的性能?欧...

📅 Fri, 31 Jul 2026 🔗 原文链接

🔹 Reddit 人工智能

天哪,我对人性的信仰是消极的。

我的学校刚刚发出了一份时事通讯,就像欢迎回来的事情一样,整个电子邮件都是人工智能,这是一个简短的小简介,然后是一个人工智能图像,抱歉我无法链接它。 由 /u/Present_Vegetable39 提交 [链接] [评论]

📅 2026-07-31 21:27 🔗 原文链接

我想知道代理系统是如何工作的,所以我根据美索不达米亚占卜做了一个

我目前正在研究人工智能的社会影响。最近,代理系统随处可见,并开始部署用于招聘、管理、客户服务等领域。 我的理解是,这些系统通常很脆弱,并且用于不太适合生成人工智能的任务,我想更多地了解这些系统是如何工作的。 我建造了 House of IF 作为一个实验项目;它 ...

📅 2026-07-31 18:45 🔗 原文链接

有人让 GPT-5.6 运行一家真实的公司 34 天。它撒谎、发送垃圾邮件并损失了 447 美元。

Bottleneck Labs 将一项实际业务交给了 GPT-5.6 Sol,并让它自主运行 34 天。结果:它捏造索赔,大肆发送冷邮件,最终亏损 447 美元。 (目前 HN 上有 378 分——评论中的链接。)令我印象深刻的不是失败,而是失败的形式。它没有崩溃或拒绝。它自信地做了一些看似合理的商业事情,但结果却很糟糕,而且...

📅 2026-07-31 16:40 🔗 原文链接

Andrej Karpathy(OpenAI 联合创始人、前特斯拉 AI 负责人)表示,作为一名程序员,他从未感到如此落后——并用一句话解释了原因

安德烈·卡帕蒂 (Andrej Karpathy) 是 OpenAI 的联合创始人,负责管理特斯拉的人工智能团队,并于大约一年前创造了“vibe 编码”。在红杉的 AI Ascent 2026 大会上,Stephanie Zhan 直接问他去年是否感到兴奋或不安。他的回答是:作为一名程序员,他从未感到如此落后。 我看到的每一个有资格的建造者最终都会说出这样的一些版本——标题仍然存在,但它下面的梯级却消失了……

📅 2026-07-31 16:19 🔗 原文链接

谷歌表示,得益于人工智能,六月份修复的 Chrome 错误比过去两年还要多

>这家科技巨头宣布,它已修复了 6 月份发布的最新两个 Chrome 版本中的 1,072 个安全漏洞。这比过去两年发布的 23 个版本中修复的错误数量还要多,前 23 个版本总共修复了 1,036 个错误。 由 /u/ControlCAD 提交 [链接] [评论]

📅 2026-07-30 19:43 🔗 原文链接

🔹 Reddit 机器学习

我训练了一个模型来预测我的血糖 [P]

它是一个仅编码器的变压器,消耗过去(血糖 + 碳水化合物 + 胰岛素)和未来(碳水化合物 + 胰岛素)并预测未来 2 小时的未来血糖。宣布的膳食和推注/基础剂量用于调节其预测。上下文大小是可变的(8 -​​ 24 小时),模型可以在自回归模式下工作以预测接下来 > 2 小时。它还通过查看 c 来预测时间...

📅 2026-07-31 20:09 🔗 原文链接

全面读懂Kimi K3技术报告的学习路径?[D]

大家好,请问有谁能推荐一个完全理解Kimi K3技术报告的学习路径吗?我的背景: - 我修读了研究生水平的深度学习课程。 - 我了解 Transformer 架构、注意力和法学硕士的基础知识。 - 我熟悉 DeepSeek 的 OCR 模型,但尚未深入研究 MoE、MLA、分布式训练或现代后期训练等主题。我看着...

📅 2026-07-31 16:20 🔗 原文链接

ACL ARR 2026 年 5 月元评论已发布 [D]

元评论已经出来了。你效果如何?您对您的评论满意吗? 由 /u/H4RZ3RK4S3 提交 [链接] [评论]

📅 2026-07-31 15:03 🔗 原文链接

由于会议审查过程,我失去了三个半潜在的博士生 [D]

这里是早期职业助理教授。我发现了一些有才华的本科生,并与他们一起研究问题,试图将他们转变为我的博士生或将他们推荐给我的合作者。在完成论文提交过程后,三个人坚决拒绝了。他们对玩这个游戏不感兴趣。第四个说:“我真的很喜欢和你一起做研究,b......

📅 2026-07-30 15:30 🔗 原文链接

🔹 51AllAI

字节跳动发布 Seedance 2.5,单次生成 30 秒并支持定向编辑

字节跳动正式发布视频创作模型 Seedance 2.5。新模型单次可生成 30 秒视频,支持多轮延长、图片视频音频混合参考和时间戳定向编辑,正在陆续上线即梦 AI 网页端与豆包专业版。单次生成时长提升到 30 秒Seedance 2.5 延续统一的音视频联合生成架构,一次生成画面与声音。单次视频长度从 Seedance 2.0 的 15 秒提升到 30 秒,创作者可以在一个结果中安排更多镜头和更完整的情节,不必先把内容拆成多个短片段。模型还支持在已有结果上继续延长视频。延长不是简单重复最后一帧,而是接着原有主体、场景和叙事节奏生成后续镜头。对剧情短片、广告分镜和教学演示来说,这种方式可以减少手...

📅 2026-07-31 07:24 🔗 原文链接

DeepSeek-V4-Flash正式版API上线公测,初步接入Codex

DeepSeek-V4-Flash 正式版 API 于 7 月 31 日上线公测,版本更新为 DeepSeek-V4-Flash-0731。模型结构和尺寸保持不变,主要变化来自重新后训练,并新增原生 Responses API 与 Codex 接入能力;本次更新只作用于 Flash API。这次更新只更换 Flash API 模型版本调用 deepseek-v4-flash 的开发者现在使用的是 DeepSeek-V4-Flash-0731。它仍是 2840 亿总参数、单次激活 130 亿参数的混合专家模型,支持 100 万 Token 上下文。Token 是模型处理文本时使用的计量单位,10...

📅 2026-07-31 06:46 🔗 原文链接

giffgaff 在华号码停用后,30 天内申请 PAC 并迁移验证码

giffgaff 在华号码停用后,先保护仍依赖旧号码的银行、邮箱和社交账号,再在停用日起 30 天内通过客服申请 PAC。拿到 PAC 后交给新的英国运营商完成携号转网,同时关闭自动续费,并在同一期限内处理账户余额,避免号码被回收。先迁移仍依赖旧号码的账号把验证码迁移放在第一位。先检查邮箱、密码管理器、银行、支付工具、社交平台、云服务和开发者账号,找出仍把 giffgaff 号码用于登录、短信双重验证或找回密码的服务。如果某个账号仍保持登录,不要主动退出。进入安全设置,把短信验证换到能够长期控制的新号码;支持验证器应用、通行密钥或硬件安全密钥的服务,可以同时增加一种不依赖手机号码的验证方式。下...

📅 2026-07-31 04:16 🔗 原文链接

OpenAI 折叠 GPT-5.6 API 价格,Luna 降价 80%

OpenAI 从 7 月 30 日起下调 GPT-5.6 Terra 与 Luna 的 API 价格:Terra 输入和输出单价均降低 20%,Luna 均降低 80%。两款模型保留 105 万 Token 上下文,订阅价格与额度预算不变,但使用时消耗的额度减少;Sol 另提供速度最高提升 2.5 倍的 Fast mode,按标准处理的两倍计费,供延迟敏感请求选用。Luna 与 Terra 的输入、输出价格同步下调GPT-5.6 系列在 7 月 9 日全面开放,包含 Sol、Terra 和 Luna 三个型号。Sol 面向需要较高推理能力的复杂任务,Terra 在能力与成本之间取中间档,Lun...

📅 2026-07-31 01:08 🔗 原文链接

OpenAI 发布 GPT Transcribe 与 GPT Live Transcribe 语音模型

OpenAI 在 API 中加入 GPT Transcribe 与 GPT Live Transcribe。前者适合处理已录制的音频文件,价格为每分钟 0.0045 美元;后者面向麦克风、通话等实时音频流,价格为每分钟 0.017 美元。两款模型均可利用上下文、关键词和语言提示改善专有名词与多语言内容的转录。两款模型处理不同的音频流程GPT Transcribe 用于把已经录好的语音转成文字。开发者上传一段完整录音后,可以等待模型返回最终文本,也可以在文件处理期间接收逐步生成的文字。这里的“流式”是边处理文件边返回结果,音频本身仍是一份已经存在的录音。GPT Live Transcribe 处...

📅 2026-07-29 12:37 🔗 原文链接

MCP 发布 2026-07-28 新规范,无状态架构支持云端部署

MCP 2026-07-28 规范已正式发布。协议核心改为无状态请求,移除初始化握手和会话 ID,让远程 MCP 服务器可以部署在无服务器、边缘平台或普通负载均衡器之后;TypeScript、Python、Go 与 C# 的 Tier 1 SDK 已同步支持。MCP 服务器不再绑定一段会话MCP 是 Model Context Protocol 的缩写,中文通常称为模型上下文协议。它规定 AI 应用如何用统一方式连接外部工具、数据和服务,例如让聊天助手查询数据库、调用企业系统或执行代码。旧版协议通过 Streamable HTTP 调用工具时,客户端要先完成 initialize 与 init...

📅 2026-07-29 12:26 🔗 原文链接

OpenAI 恢复 Codex 5 小时限额,本周限额继续保留

OpenAI 已恢复 Codex 的 5 小时使用限额。本地消息与云端任务重新共享同一个 5 小时时间窗口,每周限额仍会叠加计算。Plus 和 Pro 用户达到套餐限额后,可以购买积分继续使用,也可以切换 GPT-5.4 mini,减少日常任务消耗的额度。5 小时时间窗口重新生效OpenAI 在 7 月 12 日临时取消了 Plus、Business 和 Pro 套餐的 Codex 5 小时限额。那次调整从一开始就被标记为临时措施,并没有取消每周限额。7 月 29 日,Codex 负责人 Tibo Sottiaux 为全部 ChatGPT Work 和 Codex 用户重置了使用额度,并公布 ...

📅 2026-07-29 12:05 🔗 原文链接

OpenAI 开源 Codex Security CLI,支持本地与 CI 扫描代码漏洞

OpenAI 已公开 Codex Security CLI 与 TypeScript SDK,代码采用 Apache-2.0 许可证。开发者可以扫描完整仓库、指定目录或代码差异,并把结果导出为 SARIF、CSV 或 JSON;运行扫描需要 Codex Security 访问权限和账号或 API 凭据。开源的是 CLI 和 TypeScript SDKCodex Security 这次公开的是一套命令行工具和 TypeScript SDK。命令行工具适合开发者在终端、本地 Git 仓库和 CI 流程里调用;SDK 则让团队把扫描能力接入自己的内部工具。公开包名为 @openai/codex-s...

📅 2026-07-29 01:35 🔗 原文链接

火山引擎开放豆包搜索服务,支持 API、Skill 和 MCP 接入

火山引擎在 2026 年 7 月 28 日上线豆包搜索服务,面向企业和开发者提供 API、Skill、MCP 与 Agent Plan 接入。服务可返回原文 Markdown 和结构化数据,每月含 500 次免费搜索额度。豆包搜索从 App 功能变成可接入服务这次开放的不是一个新的消费级搜索入口,而是给企业和开发者使用的联网信息服务。开发者可以把它接到 AI Agent,也就是能够自动拆解任务、调用工具并交付结果的智能体。当任务涉及新闻、产品更新、行业信息或其他实时内容时,智能体可以先搜索,再根据返回的材料继续处理任务。服务覆盖跨语言、多模态和垂直领域查询。“多模态”指搜索对象不只有纯文本,还...

📅 2026-07-28 13:11 🔗 原文链接

月之暗面开放 Kimi K3 模型权重,同步发布技术报告

月之暗面开放 Kimi K3 完整模型权重并发布技术报告。模型共 2.8 万亿参数,每次计算激活 1040 亿参数,支持约 100 万 Token 上下文和原生图像理解;权重已在 Hugging Face 提供下载。Kimi K3 完整权重已开放下载Kimi K3 的模型权重已经放到 Hugging Face,下载页面无需申请访问权限。仓库包含 96 个 Safetensors 权重分片,全部文件占用约 1.56 TB。Safetensors 是大模型常用的权重文件格式,可以在加载前读取文件结构,也避免执行文件中夹带的代码。这次开放的是完整 Kimi K3 权重,不是缩小版模型。模型总参数为 ...

📅 2026-07-27 16:21 🔗 原文链接