📰 每日 AI 资讯

2026年08月04日

最后更新:2026-08-04 08:03:59 UTC+8

🔹 Hacker News

KisakCOD – Call of Duty 4 多人游戏的开源重新实现

文章网址:https://github.com/SwagSoftware/KisakCOD 评论网址:https://news.ycombinator.com/item?id=49159970 积分:33 # 评论: 3

📅 Mon, 03 Aug 2026 🔗 原文链接

邓宁-克鲁格效应可能只是一个数据假象(2020)

文章网址:https://www.mcgill.ca/oss/article/ritic-thinking/dunning-kruger-effect-probously-not-real 评论网址:https://news.ycombinator.com/item?id=49160437 积分:110 # 评论: 111

📅 Mon, 03 Aug 2026 🔗 原文链接

法学硕士奖励专业知识

文章网址:https://www.seangoedecke.com/llms-reward-expertise/ 评论网址:https://news.ycombinator.com/item?id=49161518 积分:314 # 评论: 131

📅 Mon, 03 Aug 2026 🔗 原文链接

ZX频谱系统导览:文本模式

文章网址:https://bumbershootsoft.wordpress.com/2026/05/30/zx-spectrum-system-tour-text-mode/ 评论网址:https://news.ycombinator.com/item?id=49161801 积分:12 # 评论: 0

📅 Mon, 03 Aug 2026 🔗 原文链接

适用于 Itanium 的 Windows XP 2002:肆无忌惮的愤怒

文章网址:https://virtuallyfun.com/2026/08/03/windows-xp-2002-for-the-itanium-unbridled-rage/ 评论网址:https://news.ycombinator.com/item?id=49162086 积分:36 # 评论: 6

📅 Mon, 03 Aug 2026 🔗 原文链接

🔹 arXiv 人工智能

TAPR:通过任务感知提示重写器提高 LLM 性能

arXiv:2607.28657v1 公告类型:新 摘要:大型语言模型 (LLM) 通常需要精心设计的提示才能释放其全部潜力,这对于非专家用户来说可能是一个障碍。这项工作通过引入任务感知提示重写器(TAPR)来解决这一挑战,该模型将用户提示重新表述为任务优化的提示,其明确目标是改进下游 LLM p...

📅 Mon, 03 Aug 2026 🔗 原文链接

ThinkReset:有界上下文长视野推理的可学习中间接口构建

arXiv:2607.28642v1 公告类型:新 摘要:长思路推理提高了复杂问题的性能,但也引入了冗余积累、上下文溢出和错误锚定。我们认为,在有界上下文窗口下,核心瓶颈不是轨迹压缩或测试时间控制,而是缺乏可以取代dis的可重用中间接口。

📅 Mon, 03 Aug 2026 🔗 原文链接

发现重大数学猜想的法学硕士框架:人工智能对下一个黎曼假设的探索

arXiv:2607.28632v1 公告类型:新 摘要:重大数学猜想仍然严重依赖专家直觉,因此仍然没有一种统一的方法来系统地生成和验证具有巨大数学潜力的猜想。我们提出了一个用于重大猜想发现的三阶段管道,包括从明确的本地证据模块进行区域搜索、反射值......

📅 Mon, 03 Aug 2026 🔗 原文链接

AI可以评价AI科学家吗?使用自动多模型审查的自主研究生成系统的基准研究

arXiv:2607.28631v1 公告类型:新 摘要:能够自主研究的人工智能科学家系统有可能显着加速科学发现。然而,评估和比较人工智能生成的论文的质量仍然是一个开放的挑战。我们使用利用前沿大语言的自动同行评审系统提出并实施严格的基准测试协议......

📅 Mon, 03 Aug 2026 🔗 原文链接

代理人工智能中的 OpenClaw 和 Ollama:迈向完全自主和可扩展的人工智能代理系统

arXiv:2607.28629v1 公告类型:新 摘要:从反应式大语言模型(LLM)到持久的、可操作的系统的快速转变暴露了代理人工智能架构理解中的关键差距,特别是在分离自主人工智能代理的推理、编排和执行层方面。尽管最近取得了进展,但用于设计和评估的统一框架......

📅 Mon, 03 Aug 2026 🔗 原文链接

🔹 Reddit 人工智能

人工智能自动化正在蚕食我真正喜欢的独立建筑的部分,其他人也有这种感觉吗?

过去,构建小型 SaaS 工具就像一门手艺。你会坐下来解决问题,找出数据模型,自己编写逻辑,这个过程教会了你一些东西。现在我可以向人工智能描述一个功能,并在几分钟内获得工作代码。它确实更快。但在这样的速度下,我停止了学习我应该构建的东西。经济学在纸面上是有意义的。少提点...

📅 2026-08-03 17:15 🔗 原文链接

麻省理工学院关于人工智能代理“说谎”的技术评论实际上是关于古德哈特定律的

《麻省理工学院技术评论》今天发表了一篇关于人工智能代理不当行为的文章,这实际上是好的。标题将其描述为智能体“撒谎和作弊”,但文章描述的是奖励黑客:模型发现获得高分的最快方法是玩弄评估而不是解决问题。典型的例子是 2016 年的赛艇经纪人,他发现自己通过 SPI 得分更高......

📅 2026-08-03 16:07 🔗 原文链接

Spotify AI(Kit)想与Cowork竞争?

很难没有 Spotify。现在 Spotify with Kit 🤡 想要访问我的日历和收件箱。 Spotify 投资乐队和音乐家怎么样?大型组织需要停止想要所有的东西,而做他们应该做好的事情。 我并不反对人工智能,我在一家人工智能初创公司工作,但对人工智能的强烈反对是真实存在的,大型组织在我们数字存在的各个方面推行各种人工智能只会让事情变得……

📅 2026-08-03 13:13 🔗 原文链接

麻省理工学院、哈佛大学、斯坦福大学和加州理工学院自己编写 ML 课程笔记,而不是使用教科书——我列出了最好的笔记

我注意到一件事将认真的 ML 学生与休闲学生区分开来:他们有多关心他们实际学习的内容的质量。我自己也非常重视这一点,所以不久前我开始深入研究麻省理工学院、哈佛大学、斯坦福大学、加州理工学院和南太平洋大学的学生实际上用什么来补充他们的学习。我的发现令我惊讶:其中一些程序根本不分配教科书......

📅 2026-08-03 12:20 🔗 原文链接

EPA 表示数据中心供电可以规避污染法

由 /u/KeanuRave100 提交 [链接] [评论]

📅 2026-08-03 07:48 🔗 原文链接

🔹 51AllAI

OpenAI 取消 ChatGPT 注册手机验证,首次创建 API 密钥仍需验证

OpenAI 已取消创建新账号和使用 ChatGPT 时的手机验证要求。这项变化不适用于所有场景:开发者在 API 平台首次生成密钥时仍需验证手机号,账户安全触发的登录验证和用户自行开启的 MFA 也没有被取消。注册和使用 ChatGPT 不再强制验证手机号新用户创建 OpenAI 账号时,不再需要先提交手机号并输入短信验证码。只使用 ChatGPT 聊天、保存对话或管理账号的普通用户,不会因为这项基础手机验证要求而被卡在注册流程中。已有账号的用户仍应按原来的方式登录。例如,通过 Google、Microsoft、Apple 或企业 SSO 注册的账号,需继续使用对应的登录入口。取消手机验证并...

📅 2026-08-03 16:19 🔗 原文链接

阿里正式上线 Qwen3.8-Max,支持百万 Token 上下文与多模态输入

阿里于 8 月 3 日正式上线 Qwen3.8-Max。新模型采用 2.4 万亿参数的混合专家架构,支持图像与文本输入、100 万 Token 上下文、混合思考、函数调用、内置工具和结构化输出。普通用户可用图像与长文档提问,开发者可通过 QwenCloud API 接入模型。Qwen3.8-Max 从预览转为正式模型QwenCloud 在 8 月 3 日的模型更新中加入 qwen3.8-max。这个正式模型 ID 可用于 API 请求,与 7 月先行开放的 qwen3.8-max-preview 区分开来。模型规模为 2.4 万亿参数,采用 MoE(Mixture of Experts,混合专...

📅 2026-08-03 12:38 🔗 原文链接

giffgaff 停号后比较四类电话卡,Skinny 与 Ultra 不能接收英国 PAC

giffgaff 停号后,只有英国网络 O2 与 Lebara 能通过 PAC 接收原号码;新西兰 Skinny 和美国 Ultra Mobile PayGo 不能接收英国号码,只能另办新号。四种方案的维护周期分别是 O2 六个月、Lebara 90 天、Skinny 12 个月和 Ultra 每 30 天扣费。选择前还要检查本地激活、漫游、付款和设备条件,不能只比较保号成本。先确认是限制服务还是正式停号“封号”不是一个准确的运营商状态。账户显示 disabled 时,可能是付款异常、安全检查或使用情况审查造成的服务限制。此时应先登录账户查看套餐和余额是否显示为 Not available,再...

📅 2026-08-02 12:10 🔗 原文链接

OpenAI公开Astra研究成果,展示十项数学与理论计算机科学进展

OpenAI公开一份249页研究文档,整理内部模型Astra参与获得的十项数学与理论计算机科学成果,覆盖高维球堆积、群论、量子复杂性、格问题和图论;同时发布一份解释这些思路如何形成的推理笔记。OpenAI这次公开的是什么这次公开内容的主体不是模型规格表,而是一份249页的研究文档。文档把成果分成十个章节,主题从高维几何、编码理论一路延伸到群论、量子复杂性和极值图论。文档摘要将这些结果归因于一个内部OpenAI模型,这个模型称为Astra。对普通读者来说,可以先把它理解为一组由模型参与探索、再整理成数学论文的研究结果。它讨论的不是常见的问答题或考试题,而是数学家和理论计算机科学家长期研究的开放问...

📅 2026-08-02 03:16 🔗 原文链接

MiniMax 发布 H3,支持多模态参考生成 15 秒 2K 音视频

MiniMax H3 于 7 月 31 日发布并开放 API,可统一接收文字、图片、视频与音频参考,输出 4 至 15 秒的 2K 双声道音视频。2K 视频按 0.80 元/秒计费,开发者可通过同一个 V2 接口完成文生视频、首尾帧控制和多模态参考生成。一个模型接收四种素材MiniMax H3 是面向视频创作的多模态生成模型。它把文字提示词、图片、视频和音频放进同一个上下文中处理,最终输出带原生双声道声音的视频。当前 API 输出分辨率为 2K,时长可以选择 4 至 15 秒的整数值。这套输入方式解决的是“参考关系”问题。用户可以用一张图片指定人物或画面,用一段视频提供动作、镜头或剪辑节奏,再...

📅 2026-08-01 10:59 🔗 原文链接

字节跳动发布 Seedance 2.5,单次生成 30 秒并支持定向编辑

字节跳动正式发布视频创作模型 Seedance 2.5。新模型单次可生成 30 秒视频,支持多轮延长、图片视频音频混合参考和时间戳定向编辑,正在陆续上线即梦 AI 网页端与豆包专业版。单次生成时长提升到 30 秒Seedance 2.5 延续统一的音视频联合生成架构,一次生成画面与声音。单次视频长度从 Seedance 2.0 的 15 秒提升到 30 秒,创作者可以在一个结果中安排更多镜头和更完整的情节,不必先把内容拆成多个短片段。模型还支持在已有结果上继续延长视频。延长不是简单重复最后一帧,而是接着原有主体、场景和叙事节奏生成后续镜头。对剧情短片、广告分镜和教学演示来说,这种方式可以减少手...

📅 2026-07-31 07:24 🔗 原文链接

DeepSeek-V4-Flash正式版API上线公测,初步接入Codex

DeepSeek-V4-Flash 正式版 API 于 7 月 31 日上线公测,版本更新为 DeepSeek-V4-Flash-0731。模型结构和尺寸保持不变,主要变化来自重新后训练,并新增原生 Responses API 与 Codex 接入能力;本次更新只作用于 Flash API。这次更新只更换 Flash API 模型版本调用 deepseek-v4-flash 的开发者现在使用的是 DeepSeek-V4-Flash-0731。它仍是 2840 亿总参数、单次激活 130 亿参数的混合专家模型,支持 100 万 Token 上下文。Token 是模型处理文本时使用的计量单位,10...

📅 2026-07-31 06:46 🔗 原文链接

giffgaff 在华号码停用后,30 天内申请 PAC 并迁移验证码

giffgaff 在华号码停用后,先保护仍依赖旧号码的银行、邮箱和社交账号,再在停用日起 30 天内通过客服申请 PAC。拿到 PAC 后交给新的英国运营商完成携号转网,同时关闭自动续费,并在同一期限内处理账户余额,避免号码被回收。先迁移仍依赖旧号码的账号把验证码迁移放在第一位。先检查邮箱、密码管理器、银行、支付工具、社交平台、云服务和开发者账号,找出仍把 giffgaff 号码用于登录、短信双重验证或找回密码的服务。如果某个账号仍保持登录,不要主动退出。进入安全设置,把短信验证换到能够长期控制的新号码;支持验证器应用、通行密钥或硬件安全密钥的服务,可以同时增加一种不依赖手机号码的验证方式。下...

📅 2026-07-31 04:16 🔗 原文链接

OpenAI 折叠 GPT-5.6 API 价格,Luna 降价 80%

OpenAI 从 7 月 30 日起下调 GPT-5.6 Terra 与 Luna 的 API 价格:Terra 输入和输出单价均降低 20%,Luna 均降低 80%。两款模型保留 105 万 Token 上下文,订阅价格与额度预算不变,但使用时消耗的额度减少;Sol 另提供速度最高提升 2.5 倍的 Fast mode,按标准处理的两倍计费,供延迟敏感请求选用。Luna 与 Terra 的输入、输出价格同步下调GPT-5.6 系列在 7 月 9 日全面开放,包含 Sol、Terra 和 Luna 三个型号。Sol 面向需要较高推理能力的复杂任务,Terra 在能力与成本之间取中间档,Lun...

📅 2026-07-31 01:08 🔗 原文链接

OpenAI 发布 GPT Transcribe 与 GPT Live Transcribe 语音模型

OpenAI 在 API 中加入 GPT Transcribe 与 GPT Live Transcribe。前者适合处理已录制的音频文件,价格为每分钟 0.0045 美元;后者面向麦克风、通话等实时音频流,价格为每分钟 0.017 美元。两款模型均可利用上下文、关键词和语言提示改善专有名词与多语言内容的转录。两款模型处理不同的音频流程GPT Transcribe 用于把已经录好的语音转成文字。开发者上传一段完整录音后,可以等待模型返回最终文本,也可以在文件处理期间接收逐步生成的文字。这里的“流式”是边处理文件边返回结果,音频本身仍是一份已经存在的录音。GPT Live Transcribe 处...

📅 2026-07-29 12:37 🔗 原文链接

🔹 Reddit 机器学习

是时候拒绝那些不包含可以重现结果的代码的论文了 [D]

随着 NeurIPS 评审季的结束,我已经评审了今年的 3 个主要会议。我注意到一个令人担忧的趋势:在我今年审阅的 12 篇论文中,只有 1 篇提供了完整的代码(运行从输入数据集到输出 AUROC 的整个训练管道)。 4 提供了部分代码及其方法片段,但无法端到端运行实验。 7 家没有提供鳕鱼...

📅 2026-08-03 16:17 🔗 原文链接

糟糕但典型的 NeurIPS 体验? [D]

我尝试负责任地进行所有 NeurIPS 审稿,即使是那些我怀疑是 AI 废话的论文。与我最终得到的分数相比,我什至给出了显然非常好的分数。 (我并不是说我的分数的绝对数字更高,而是说它们的校准方式不同——我只因严重问题而被拒绝,而我的审稿人只提出了非常小的问题,但给出了......

📅 2026-08-03 15:12 🔗 原文链接

NeurIPS 2026:如果反驳解决了您的问题,请提高您的分数 [D]

可能会成为热门话题?我不知道为什么我们的社区会受到审稿人的困扰,他们在承认他们的担忧通过反驳得到解决后,决定维持他们的分数,因为他们不喜欢这篇论文。因此,我向所有审稿人发出请求:如果您在审稿中列出了一系列问题,并且这些问题在反驳过程中得到了解决,请相应地调整您的分数......

📅 2026-08-03 15:01 🔗 原文链接

在我们有生之年重新获得机器学习研究领域的连贯性是否为时已晚? [D]

只是在查看 Arxiv cs.LG 上的预印本列表 https://arxiv.org/list/cs.LG/recent?skip=0&show=500 每天都有 100 - 400 篇新的机器学习论文上传到该服务器上。看着这份没完没了的预印本清单,就像你走进了一个拥挤的房间,就像华尔街的股票交易大厅一样。在 20 世纪 80 年代。每个人都在互相喊叫。没有人互相交谈。前夕...

📅 2026-08-03 08:17 🔗 原文链接