2026年08月07日
最后更新:2026-08-07 08:07:31 UTC+8
文章网址:https://www.sciencedaily.com/releases/2026/08/260803080917.htm 评论网址:https://news.ycombinator.com/item?id=49202716 积分:35 # 评论: 1
文章网址:https://www.aleksagordic.com/blog/vllm 评论网址:https://news.ycombinator.com/item?id=49202852 积分:36 # 评论: 2
Pokémon Emerald 移植到 RP2350 微控制器。无模拟器,60 fps HDMI 输出。从 ARMv4T 重新编译为 Cortex-M33,Game Boy Advance 的视频硬件在第二个内核的软件中重新实现。 评论网址:https://news.ycombinator.com/item?id=49203059 积分:33 # 评论: 13
文章网址:https://www.troyhunt.com/welcoming-the-nepalese-government-to-have-i-been-pwned/ 评论网址:https://news.ycombinator.com/item?id=49203105 积分:51 # 评论: 12
作者在这里。背景,对于那些没有关注这场斗争的人:IBM 的铁硫 SQD 结果(Sci. Adv. 2025)是“量子计算机现在对化学有用”的旗舰声明之一,并且已发表的评论(arXiv:2501.07231)认为量子样本从未以匹配的成本击败经典的选择 CI。这种争论仍然存在。双方一直在能源问题上争论不休。也不是我...
arXiv:2608.04095v1 公告类型:新 摘要:大型语言模型(LLM)代理越来越多地被用作财务咨询等高风险领域的个性化助手,但目前尚不清楚它们是否可以长期维护和更新个性化用户模型。现有的个性化内存基准主要测试事实保留或依赖于弱约束模型......
arXiv:2608.04077v1 公告类型:新 摘要:评估金融人工智能代理需要符合实际专业工作的标准。现有的评估标准方法通常从任务提示或模型输出中得出标准,而忽略了仅在从业者可交付成果中可见的默认标准。我们介绍 FinProBench(专业财务任务的基准)和基于角色的评分标准构建...
arXiv:2608.04071v1 公告类型:新 摘要:从结构化表格数据自动生成包含文本分析和可视化图表的专业多模式报告是数据智能中的一项关键挑战。现有方法存在固定的线性管道和孤立的子任务处理,这阻碍了事实准确性、视觉质量和叙述的联合优化......
arXiv:2608.04066v1 公告类型:新 摘要:当你无法信任长期代理的状态和自我报告时,如何验证它?我们提出了一种代理工具,使验证是结构性的而不是事后的。一个确定性的执行者拥有所有的信念;语言模型只能提交键入的提案,并且只有在预测预注册时才接受声明...
arXiv:2608.04012v1 公告类型:新 摘要:人们越来越期望人工智能系统能够在交互、适应和更新的重复循环中运行,而不是通过孤立的一次性输出。这就提出了一个基本的理论问题:人工智能系统能否无限期地持续存在而不会导致无限制的结构老化?本文提出了一种长期坚持...
我们收到了元审稿人的评论。但我再也看不到它了。还有其他人有同样经历吗?这有什么意义吗? 由 /u/Beautiful_Baker_2233 提交 [链接] [评论]
我们正在研究是否可以在适当的情况下通过自动构建的正则表达式、确定性解析器、传统 ML 和 NLP 模型的管道来取代重复出现的 LLM 工作负载。 举个例子,假设一个应用程序反复要求前沿模型读取年度报告,并将所有客户-供应商关系作为包含客户、供应商和供应商的结构化记录返回...
除了其他更客观的基准之外,“Arena ai”在产生基于人类偏好的排名方面取得了巨大成功。然而,这(可能)也在同步危机和某些模型倾向于过度格式化以引发用户流畅感(认知负载理论)的总体趋势中发挥了作用。马克斯·普朗克智能系统研究所的人们(...
无论是生成 CELEBV-HQ 视频还是湍流等离子体场(数字孪生),自回归模型(例如潜在扩散或流动模型)都会在长期部署过程中积累误差,但在部署时没有可供衡量的基本事实。 我训练了一个单一的条件潜在扩散模型,该模型通过方向标志使动态系统在时间上向前或向后移动,并表明该双向...
阿里云于 2026 年 8 月 6 日开放 Wan3.0 公测。新模型单段最长可生成 30 秒视频,并把输入范围扩展到文字、图片、音频、视频和常见办公文档,用户可通过多个网页及 PC 端入口试用。单段视频最长 30 秒Wan3.0 是阿里云新一代视频生成模型。此次公测把单段生成时长提高到最长 30 秒,用户可以在一个片段里安排更完整的动作、镜头移动和情节变化,减少先生成多个短片再拼接的步骤。模型提供智能时长功能,可根据提示词推荐视频长度。已经生成的视频也可以继续延长,用于接续镜头或扩展剧情。对普通创作者来说,较长的单段时长更适合产品演示、教学说明和有连续动作的短视频。办公文档可以直接作为创作输...
DeepSeek 预告近期整体上调 API 服务价格,并称预计涨幅较大。此次消息针对开放平台 API;现行 V4-Flash 与 V4-Pro 仍按输入、输出及缓存命中情况分别计费,开发者可以先用当前单价核算项目的成本基线。DeepSeek预告整体上调API服务价格DeepSeek 于 8 月 6 日向 API 用户发出调价预告:平台计划近期整体上调 API 服务定价,预计涨幅较大,并提醒用户合理安排使用。公告指向开放平台提供的 API 服务,也就是开发者把 DeepSeek 模型接入网站、软件或自动化流程时使用的接口。DeepSeek 定价文档当前列出 V4-Flash 与 V4-Pro 的...
Cloudflare 开源内部 AI 办公平台 Cloudflare OS。它把智能体对话、可修改的小应用和权限治理放进同一工作空间,代码采用 Apache 2.0 许可证,并提供本地运行及部署到 Cloudflare 账户的入口。当前版本属于 Early Access。它不是电脑操作系统Cloudflare OS 是一套面向企业工作的 AI 生产力环境,最初用于 Cloudflare 内部。用户从浏览器里的对话开始,为工作空间交代目标;智能体可以结合组织准备的知识、技能和已连接资源完成任务,还能把结果做成文档、小应用或持续处理的工作流程。名字里的“OS”不是 Windows、macOS 那类...
OpenAI 将于 2026 年 8 月 31 日从使用 ChatGPT 账号登录的 Codex 中移除 GPT-5.4 与 GPT-5.4 mini。两款模型在 OpenAI API 和使用 API Key 认证的 Codex 会话中仍可继续使用,受影响的用户需要提前调整模型配置。这次调整只影响 ChatGPT 账号登录8 月 31 日之后,使用 ChatGPT 账号登录 Codex 的用户将无法继续选择 GPT-5.4 和 GPT-5.4 mini。这里的变化针对 Codex 的 ChatGPT 登录方式,并不是两款模型在所有渠道统一停止服务。OpenAI API 不在此次调整范围内。使用...
Cloudflare 发布 Wallets,并开放 cloudflare.pay 账户标识认领。完整支付功能将随后上线,计划支持稳定币收付,以及供 AI Agent 使用的虚拟钱包;账户所有者可设置额度、允许名单和单笔交易上限。现在开放的是账户标识认领Cloudflare Wallets 面向需要在网络上自动购买服务的 AI Agent。8 月 4 日开放的第一项能力,是让 Cloudflare 账户在 cloudflare.pay 认领一个唯一的 Wallet handle,也就是容易记忆的账户标识。完整的钱包充值、付款和收款功能将随后提供。这一区别很重要。用户现在可以前往 cloudfla...
Cloudflare 发布 @cloudflare/computer 早期预览版,为 AI 智能体提供可持续保存文件的工作区,并把轻量 Worker 隔离环境与完整 Linux 容器放在同一套运行接口下。项目采用 MIT 许可证,当前只适合实验和原型开发。它不是一台远程桌面云电脑@cloudflare/computer 是给开发者使用的开源智能体运行时。它把文件系统、命令执行和 Git 操作整理成一套工作区接口,让 AI 智能体可以读取代码、改写文件、运行测试,再继续处理下一步任务。这里的“computer”不是带桌面窗口的消费级云电脑。它更接近一间给智能体使用的持久工作室:文件留在工作区中,...
OpenAI 已取消创建新账号和使用 ChatGPT 时的手机验证要求。这项变化不适用于所有场景:开发者在 API 平台首次生成密钥时仍需验证手机号,账户安全触发的登录验证和用户自行开启的 MFA 也没有被取消。注册和使用 ChatGPT 不再强制验证手机号新用户创建 OpenAI 账号时,不再需要先提交手机号并输入短信验证码。只使用 ChatGPT 聊天、保存对话或管理账号的普通用户,不会因为这项基础手机验证要求而被卡在注册流程中。已有账号的用户仍应按原来的方式登录。例如,通过 Google、Microsoft、Apple 或企业 SSO 注册的账号,需继续使用对应的登录入口。取消手机验证并...
阿里于 8 月 3 日正式上线 Qwen3.8-Max。新模型采用 2.4 万亿参数的混合专家架构,支持图像与文本输入、100 万 Token 上下文、混合思考、函数调用、内置工具和结构化输出。普通用户可用图像与长文档提问,开发者可通过 QwenCloud API 接入模型。Qwen3.8-Max 从预览转为正式模型QwenCloud 在 8 月 3 日的模型更新中加入 qwen3.8-max。这个正式模型 ID 可用于 API 请求,与 7 月先行开放的 qwen3.8-max-preview 区分开来。模型规模为 2.4 万亿参数,采用 MoE(Mixture of Experts,混合专...
giffgaff 停号后,只有英国网络 O2 与 Lebara 能通过 PAC 接收原号码;新西兰 Skinny 和美国 Ultra Mobile PayGo 不能接收英国号码,只能另办新号。四种方案的维护周期分别是 O2 六个月、Lebara 90 天、Skinny 12 个月和 Ultra 每 30 天扣费。选择前还要检查本地激活、漫游、付款和设备条件,不能只比较保号成本。先确认是限制服务还是正式停号“封号”不是一个准确的运营商状态。账户显示 disabled 时,可能是付款异常、安全检查或使用情况审查造成的服务限制。此时应先登录账户查看套餐和余额是否显示为 Not available,再...
OpenAI公开一份249页研究文档,整理内部模型Astra参与获得的十项数学与理论计算机科学成果,覆盖高维球堆积、群论、量子复杂性、格问题和图论;同时发布一份解释这些思路如何形成的推理笔记。OpenAI这次公开的是什么这次公开内容的主体不是模型规格表,而是一份249页的研究文档。文档把成果分成十个章节,主题从高维几何、编码理论一路延伸到群论、量子复杂性和极值图论。文档摘要将这些结果归因于一个内部OpenAI模型,这个模型称为Astra。对普通读者来说,可以先把它理解为一组由模型参与探索、再整理成数学论文的研究结果。它讨论的不是常见的问答题或考试题,而是数学家和理论计算机科学家长期研究的开放问...