2026年07月25日
最后更新:2026-07-25 08:06:59 UTC+8
文章网址:https://artificialanalysis.ai/models 评论网址:https://news.ycombinator.com/item?id=49040741 积分:82 # 评论: 35
文章网址:https://github.com/apresta/max-studio-tools 评论网址:https://news.ycombinator.com/item?id=49041546 积分:12 # 评论: 0
文章网址:https://rewardhacking.org 评论网址:https://news.ycombinator.com/item?id=49042354 积分:15 # 评论: 2
文章网址:https://www.spacex.com/launches/starship-flight-13 评论网址:https://news.ycombinator.com/item?id=49042528 积分:38 # 评论: 28
文章网址:https://news.st-andrews.ac.uk/archive/sperm-whales-blow-bubbles-to-achieve-restful-vertical-sleep/ 评论网址:https://news.ycombinator.com/item?id=49042751 积分:6 # 评论: 0
arXiv:2607.20466v1 公告类型:新 摘要:严格的基准测试通过建立爬山的共享目标,推动了自主 GPU 内核性能优化的进步,但 TPU 不存在类似的基准。我们推出了 JAXBench,这是一个 TPU 原生基准测试套件,用于在 Google Cloud TPU 上优化 AI 生成的内核。 JAXBench 包含 50 个 JAX 工作负载,这些工作负载既相关又可提供...
arXiv:2607.20464v1 公告类型:新 摘要:当语言模型在重复运行中给出不同的答案时,这种变化是否揭示了它不知道的东西?自我一致性通过多数投票将变化转化为每个问题的不确定性估计。但同样的变化是否揭示了交叉问题结构——相关问题翻转在一起,就像多样化的整体那样?我们共同...
arXiv:2607.20463v1 公告类型:新 摘要:本文提出了一种人工智能驱动的浏览器扩展,可以识别点击诱饵,帮助用户避免误导性的互联网文章。该应用程序超越了传统的检测,采用了混合机器学习架构,将基于变压器的嵌入与语言驱动的特征和自定义“诱饵”分数相结合。评价后...
arXiv:2607.20462v1 公告类型:新 摘要:大语言模型(LLM)越来越多地集成到临床工作流程中,强调需要对带有水印的模型生成的输出进行可靠的可追溯性。然而,大多数水印都是在通用基准上进行评估的,而在医学等领域,小的标记级扰动可能会导致重大的语义变化,......
arXiv:2607.20452v1 公告类型:新 摘要:现代软件质量保证需要能够跨分布式云环境进行自适应决策的智能、自主系统。本文提出了AINTMA(代理智能测试管理架构),这是一个多代理代理人工智能系统,它将传统的测试管理转变为自治的质量智能生态系统...
由 /u/esporx 提交 [链接] [评论]
由 /u/Fcking_Chuck 提交 [链接] [评论]
Moonshot AI 的 Kimi K3 展示了如何向外界开放模型可以将其他公司的计算能力转化为竞争优势 /u/scientificamerican [链接] [评论]
在 openai 版权案中,法院下令保留所有 chatgpt 输出日志,包括人们删除的聊天记录。一些用户试图干预以保护自己的对话。法院裁定他们不是当事方。他们对自己亲自输入的内容没有任何立场。两周前,出版商申请制裁,指控 openai 删除了数十亿条日志,并花了两年的时间...
由 /u/Livid_Violinist7259 提交 [链接] [评论]
我一直在追寻变压器实际上可以表达什么算法的问题——与它可以学习的算法分开。所以我构建了一个编译器:在普通 Python 中定义一个计算图,它生成执行该图的转换器的权重。结果是一个标准的 Phi-3 架构检查点,vanilla Huggingface 加载该检查点,没有自定义代码,也没有 trust_remote_code。零...
构建了一个开源 AI 编码代理,比在高达约 82k LOC 的存储库上运行 6/6 个本地化良好的任务的冷“claude -p”便宜 7%–75%。最大的区别:冷代理:6.83 美元,207 轮 AutoDev Studio:相同 bug 约 1.70 美元完整的基准测试(包括失败的情况)位于自述文件中。那么有什么不同呢?大多数人工智能编码代理从头开始重新探索存储库......
一篇新的 [arXiv 论文](https://arxiv.org/abs/2607.16165) 的有趣发现并不是前沿视觉模型未能通过每周发生的新基准,而是失败的具体形式以及模型无法通过编写自己的代码来修补它的事实。该基准名为 ActiveVision,包含 3 个类别的 17 项任务,用作者的话说,旨在“强制重复...
评论刚刚发布,我从 OpenReview 下载了我的论文,以确定需要改进的领域。然而,GPT 警告我该 PDF 包含提示注入。我从来没有插入过这样的提示。将我的原始提交内容与从 OpenReview 下载的版本进行比较后,看来该注入可能是由 NeurIPS 添加的。我想知道是否还有人...
OpenAI 为桌面端 Codex 接入由 GPT-Live 驱动的 ChatGPT Voice。用户可以边说边启动任务、询问进度、打断执行并调整方向,语音对话与后台工作不必轮流等待。Codex 从语音输入变成实时语音协作2026 年 7 月 23 日发布的 ChatGPT 桌面应用 26.715,把 ChatGPT Voice 带到了 Codex。它与原有的语音听写不是同一种交互:听写会先把一段录音转成文字,再作为提示词发送;GPT-Live 支持实时双向语音,用户可以在系统说话时插话,也可以要求它先听完再回应。这套语音能力不会替代 Codex 的任务执行界面。它更像一层实时控制入口:用户负...
OpenAI 发布 Presence,为企业部署语音与聊天智能体。它可以连接企业知识和业务系统,在明确权限内处理请求、执行获批操作或转交人工,并通过模拟评估和受控更新覆盖上线前后的管理流程。Presence 不是一个新的聊天机器人OpenAI Presence 是一套面向企业的智能体交付产品,覆盖客户服务和内部工作流程。它支持实时语音与聊天,可用于处理账单问题、保险理赔或员工 IT 服务请求等具体工作。每个智能体从一个明确任务开始,只获得完成这项任务所需的知识和系统访问权限。企业负责设定它可以执行哪些操作、哪些操作需要审批,以及什么情况下必须转交人工。智能体可以查询账户信息、应用业务规则并执行...
通义发布 Qwen-Image-3.0,最长可处理 4.5K Token 的图像生成指令,并支持 10px 小字、12 种语言和 100 多种艺术风格。新版本面向信息图、报纸、分镜、试卷与界面等文字密集型图片,普通用户可从发布页面进入千问网页端体验。最长可处理 4.5K Token 指令Qwen-Image-3.0 是 Qwen-Image 系列的第三代图像生成基础模型。它把可接受的指令长度提高到 4.5K Token。Token 是模型处理文字时使用的基本单位;可用长度越高,一条提示词就能容纳越多场景、文字、位置和版式要求。长指令主要服务于信息密度较高的图片。用户可以在一次生成中描述报纸、分...
Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。其中,3.6 Flash 在一组综合评测中比 3.5 Flash 少用 17% 输出 Token;前两款已开放 API,Cyber 版将通过 CodeMender 限量提供。三款模型分别处理通用任务、高吞吐任务和代码安全Gemini 3.6 Flash 是这次更新中的通用型号,面向编程、知识工作、多模态理解和需要连续调用工具的多步任务。多模态指模型可以同时处理文字、图片、音频、视频和 PDF,而不是只接收文字。Gemini 3.5 Flash-Lite 把重点放在高吞吐和低成...
阿里上线 Qwen-Audio-3.0-TTS,分为 Flash 和 Plus 两个版本。两者支持语音合成、自然语言指令与情绪、拟声标签,开发者可通过 DashScope API 调用。国际服务按输入字符计费,Flash 每万字符 0.15 美元,Plus 为 0.20 美元。Flash 和 Plus 面向不同场景Qwen-Audio-3.0-TTS 把文字转换为可播放的语音,支持边接收文字边返回音频的流式输出。Flash 主要用于语音助手、智能客服等对响应速度敏感的互动场景;Plus 面向有声书、新闻播报和内容配音等更重视成品质量的任务。两个版本的模型 ID 分别是 qwen-audio-3...
字节跳动发布 Seed Audio 1.0,一条提示词可以同时安排多角色对白、背景音乐、音效和环境氛围。它支持文本、参考音频或参考图片输入,单次最长生成 2 分钟音频。一条提示词完成一段声音场景普通 TTS(文字转语音)的主要任务是把文字读出来。Seed Audio 1.0 处理的对象是完整声音场景:同一次生成里可以包含多角色对白、笑声和叹息等非语言声音、背景音乐、拟音与环境声。提示词需要像一份简短的声音脚本。可以写清场景、角色、台词、语言、语气、背景声和音效出现的时机。例如,想做一段雨夜咖啡店对话,可以把两个角色的声线与台词、窗外雨声、室内杯碟碰撞声和音乐风格写在同一条指令里。模型返回的是混...
Kimi 暂停接受新会员订阅,并把算力优先分配给现有订阅用户。7 月 20 日起,Kimi 与 Kimi Code 会员权益分开:前者覆盖网页端、App 和 Work,后者面向编程工作流;老套餐可以继续使用和自动续费。Kimi 暂停接受新订阅Kimi 在 7 月 19 日宣布暂停接受新会员订阅。过去 48 小时的需求已接近现有算力容量上限,平台将计算资源优先分配给当前订阅用户,已经订阅的用户不受这次调整影响。暂停是临时措施。Kimi 正在增加算力,并会分批重新开放订阅名额。会员权益从 7 月 20 日起拆分Kimi 会员与 Kimi Code 会员将覆盖不同的产品:Kimi 会员用于网页端、A...
阿里千问预告 Qwen3.8 即将发布并开放模型权重,参数规模为 2.4T。面向用户的 Qwen3.8-Max-Preview 已进入 Token Plan、Qoder 和 QoderWork,可先在阿里旗下订阅与智能编程、桌面办公产品中体验。Qwen3.8 将以开放权重方式发布Qwen3.8 的参数规模为 2.4T,也就是 2.4 万亿参数。参数是模型在训练中学到的数值,数量反映模型规模,但不能单独代表实际效果。“开放权重”指训练完成后的模型参数文件对外提供,便于开发者在本地或自有服务器上运行和适配模型。它与同时公开训练代码、训练数据不是同一件事,因此本次预告更准确的说法是“开放模型权重”。...
Anthropic 将 Claude Code 每周使用限额提高 50% 的活动延长至 2026 年 8 月 19 日,覆盖 Pro、Max、Team 和传统按席位计费的 Enterprise 用户。活动自动生效,只适用于 Claude Code 的周限额,不改变 5 小时限额。周限额提高 50% 延长到 8 月 19 日此次活动从 2026 年 5 月 13 日持续到 8 月 19 日 23:59(太平洋时间)。适用用户的 Claude Code 每周使用限额在标准额度上提高 50%,不需要领取或修改账户设置。8 月 19 日活动结束后,Claude Code 周限额恢复到标准水平,用户的套...
Anthropic 将从 7 月 20 日起把 Claude Fable 5 纳入所有 Max 与 Team Premium 计划,最多可占每周额度的 50%。Pro 与 Team Standard 用户仍通过用量积分使用,并获得一次性 100 美元积分。7 月 20 日起纳入两类订阅Claude Fable 5 将从 2026 年 7 月 20 日起成为 Max 和 Team Premium 计划的订阅内模型,覆盖所有对应个人账户和团队高级席位。用户最多可以把每周使用额度的 50% 用在 Fable 5 上。这里的 50% 是 Fable 5 在现有周额度中的使用上限,不是额外增加一份额度。...