欢迎收看最新一期的Hunt Good 周报!
在本期内容你会看到:
7 条新鲜资讯
3 个有用工具
1 个有趣案例
3 个鲜明观点
Hunt for News|先进头条
GPT-5.6 Sol 推翻 100 多年前的麦克斯韦猜想,下一代模型突破 10 个!
数学家菲利普·阿拉图恩、加文·鲍尔和马修·D·克瓦尔海姆于 2026 年 7 月 29 日在 arXiv 上发表论文,提到由 GPT-5.6 Sol 找到了一个反例,证明了 100 多年前的麦克斯韦猜想是假的。
![]()
OpenAI 联合创始人 Greg Brockman 很快在 X 转发了这一消息,骄傲地说「这种级别的智能可以被所有人获取,并能增强每个人的能力!」
具体的发现是, 1873 年,麦克斯韦想知道由 n 个点电荷产生的电场平衡态的数量是否不能超过 (n-1)^2。而几位数学家用 GPT-5.6 Sol 发现了一个由 5 个电荷组成的三角双锥体,有 24 个平衡态,大于 (5-1)^2 。
![]()
从 2025 年的 IMO 金牌级的表现,像是一张门票推开了数理化的大门,AI 连续出现了完整证明、明确反例和人类此前没有见过的数学构造:证明 圈双覆盖猜想、 推翻雅可比猜想、证明 Erdős 平面单位距离猜想……
OpenAI 和 Anthropic 也热衷于将此类突破作为模型的最佳营销案例,但评论区的网友表示「我尝试让 5.6 证明 p = np 或 p != np 已经快一个星期了,但它仍然没有得出任何结论。请问您能修复一下吗?」
![]()
类似 AI 在数理化方面突破的消息大概会越来越多,不断进展的同时, 数学研究的工作流开始重新分工,发现、验证与解释会逐渐变成三个相对独立的环节。
![]()
昨天,OpenAI 还专门发布博客开始为下一代模型造势。
博客里面提到 Astra 的内部版本,即 OpenAI 的下一代主要模型系列解决了数学、量子复杂性和理论计算机科学中的 10 个重大开放性问题。
![]()
上下滑动查看更多内容
而这十个难题,光是证明非索菲群体的存在这一项,可能就已经能让 OpenAI 这款新模型拿到菲尔茨奖。
![]()
https://openai.com/index/ten-advances-in-mathematics/
⚠️ AI 假医生批量带货,博主称一条赚了 6.7 万美元
404 Media 曝光了一条已经跑通的 TikTok AI 带货流水线。新西兰 YouTuber Harry Chang 把制作过程拍成公开教程,还声称其中一条保健品广告拿到 130 万次播放,带来 67420 美元收入。
制作过程相当直接:复制一条已经火过的脚本,用 AI 生成人脸、声音和口型,再拼成一段新的短视频。画面里的人可以穿白大褂,也可以站在台上扮演专家,看起来像医生,实际上并不存在。
![]()
Chang 把「中老年健康」称作利润极高的赛道。他的经验也很直白:「如果想给 50 岁的人卖保健品,就把虚拟人也做成 50 岁。」年龄、肤色、口音和白大褂,都变成了提高可信度的素材。
今年 2 月,美国保健品公司 Humann 起诉竞争对手 Ambrosia Brands。诉状指控,后者通过旗下品牌 Rosabella 和私人 Discord 群培训创作者,批量制作假医生、假专家和 TED 演讲风格的广告,再从 TikTok Shop 的销量中分佣。
![]()
专门制作一些 50 岁左右的 AI 人,然后用 Ted 演讲风格推销保健品
Ambrosia 则称,诉状没有证明公司指挥了这些第三方创作者,目前法院尚未作出裁定。
这些 AI 垃圾视频正在从流量生意变成带货生意。假医生负责建立信任,TikTok Shop 完成下单,健康风险则留给了屏幕另一端的用户。
https://www.404media.co/inside-an-ai-tiktok-shop-slop-factory-that-shills-supplements-recalled-by-the-fda/
Reddit:AI 吃不掉我们
Reddit 刚交出一份漂亮财报:第二季度营收 8.05 亿美元,同比增长 61%;净利润 2.53 亿美元,增长 183%。但财报发布后,股价盘后一度跌超 10%。
但让投资者紧张的是 Google 带来的流量。
Reddit 在股东信里承认,来自搜索引擎的访问量本季度「时好时坏」,季度后半段波动更大。全球日活增至 1.303 亿,但美国日活从上一季度的 5350 万降到了 5320 万。
![]()
Reddit 有不少未登录访客来自 Google。
过去搜索一个问题,用户会点进 Reddit 看真人经验;现在 Google 把 AI 摘要放在链接前面,答案已经写好了,很多人可能看完就走。
Reddit CEO Steve Huffman并不认为 AI 能把这部分需求全部吃掉。他接受采访时表示,Google 的 AI 摘要替代不了传统搜索里的「十个蓝色链接」。
而在股东信里,他说得更直接:「人们不想看 Reddit 的摘要,他们想要的就是 Reddit。」
![]()
Reddit CEO,Steve Huffman
Reddit 的理由是,AI 可以整理信息,却很难把社区里的争论、个人经历和不同意见压成一个标准答案。公司也在努力让用户每天主动打开 Reddit,减少对 Google 流量的依赖。
2024 年,Reddit 把帖子授权给了 Google,用于改进 AI。现在这些真人讨论让 Google 的答案变得更好,也可能让用户更少点进 Reddit。
https://techcrunch.com/2026/07/30/reddit-reports-a-solid-quarter-but-shows-signs-of-ais-impact/
让 GPT-5.6 Sol、Fable 5 一起画蒙娜丽莎,一言难尽
TryAI 搭了一个 AI 画画擂台,给 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 相同的白纸和彩铅工具。
四个模型一共画了 28 张;临摹《蒙娜丽莎》和《星月夜》的 8 次作业里,最后一版全部比自己中途最好的一版更差。
这些「彩铅」是数字工具。模型没有使用一键生图,它们要自己选择颜色、笔尖粗细和下笔轻重,再一批批给出笔触的位置。
![]()
按作者的肉眼评价,GPT-5.6 Sol 赢得最轻松。它的《蒙娜丽莎》至少能认出脸、双手和背景,《星月夜》和玻璃瓶里的红玫瑰则成了作者最喜欢的两张。
Grok 画得最差,《蒙娜丽莎》像一个裹着黑白布条的人。作者直接评价:它在这项测试里「基本就是垃圾」。
![]()
机器评分给出了另一个冠军:Gemini 在两次临摹里都最接近原图。
不过这个分数只比较画面结构和像素,画得像不等于画得好看。TryAI 也明确说,这只是一场开放式趣味实验,不能当成模型能力总榜。
同时,用于评估的 SSIM 参数,衡量的是结构上的接近程度,而不是画面在人眼中的美观程度。
![]()
Claude 按作者观感排第二,代价却最高。TryAI 估算它画 7 张花了约 160 美元,平均一张需要 12.5 分钟,成本约是 GPT-5.6 的 20 倍。
https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok
225 万次浏览的 OpenAI「地狱面试」,可能是一条广告
X 上一份「OpenAI 软件工程师面试经历」火了,拿到超过 225 万次浏览。
![]()
截图里的匿名候选人说,自己刚走完整套流程:两轮技术筛选、48 小时作业、逐行盘问,最后还有 4 到 5 轮终面。
面试流程里最有意思的是一轮仍在测试的「AI 编程面试」。帖子称,候选人会拿到一个现成项目,题目故意大到无法靠手写按时完成,面试官要求你现场使用 AI 编程助手。你要让 AI 修改代码、添加功能,再把它写错的地方找出来。
面试平台 interviewing.io 也提到,OpenAI 据称正在试点类似环节,而且只有部分候选人会遇到。程序员面试考的东西也开始变了:自己一行行写代码,逐渐变成怎么指挥、检查和兜住 AI 的错误。
但这份「亲历面经」的来源经不起细看。
![]()
X 发帖人并不是面试者,只是转发了两张 Reddit 截图。Reddit 原帖又来自 InterviewCoder 的官方社区——这是一款在技术面试中提供实时编程辅助的软件。
匿名作者近期还发过 Meta、xAI、Apple 和 Google 等多家公司的「亲历面经」,其中多篇被 Reddit 过滤。
OpenAI 官方面试指南曾确认,不同团队可能安排结对编程、限时项目和技术测试,终面通常需要 4 到 6 小时。帖子里的具体题目,以及所谓「AI 编程面试」,OpenAI 都没有公开确认。
![]()
评论区也有人看出了不对劲:「如果连这篇明显由 AI 生成的 Reddit 帖都没看出来,那你已经参加完预筛了——结果是没戏。」
https://www.reddit.com/r/InterviewCoderHQ/comments/1v6yg6e/openai_software_engineer_interview_2026/
108 个 AI 女孩参加选秀,9 人成团出道
这两天, 话题 AI 女团选秀 108 位参赛 9 人成团强势冲上微博热搜,引发全网围观与热议。
抖音近期上线了全球首档 AI 女团选秀综艺互动短剧《星光 108》,将 108 位由 AI 生成的虚拟角色推上赛场。
节目沿用经典的「101」选秀模式,经过多轮唱跳公演淘汰,最终将由观众点赞投票选出 9 人成团出道。
视频来源:米兔的韩流生活/weibo
这一现象级热潮的爆发,让 2026 年被不少业内人士与网友戏称为「AI 选秀元年」。
公开的选手图很像真人选秀的公式照:淡粉背景、粉白制服、编号和名字一应俱全。潘潘、萌萌、曾庭、夏思好、Komi……8 张长图排下来,女团选秀的架势已经摆出来了。
108 张脸摆在一起后,网友还暂时顾不上挑 C 位,先开始认人。
有网友直接吐槽「又融了谁的脸。」有人觉得部分选手像一些女明星,就连名字都是跟之前的选秀节目《创造 101》等类似。还有网友说 :「现在 AI 水平还没法设计 108 个不同的女生吧?!」
![]()
但目前也没有公开信息说明这些面孔如何生成, 这 108 位 AI 选手除了拥有专属的精美公式照和立体人设,还具备完整的唱跳舞台表演能力。
相比传统真人选秀,AI 偶像最大的「杀手锏」莫过于「零塌房」风险与极高的可控性——它们没有私生活争议,不会陷入合约纠纷,且长期运营成本极低。
不过, 追算法也能追出真爱吗? 当粉丝意识到虚拟偶像镜头前的「真诚」不过是一串精心调校的 Prompt,情感上的反差落差要如何自处。
![]()
上下滑动查看更多内容
Google 给卫星图加了 AI,网友用它生成各种假图
7 月 30 日,Google 把 Nano Banana 2 的图像生成功能放到 Google Earth 网页版,用户可以在真实地点上生成新画面。
![]()
但是,不到 24 小时,Google 就宣布将它下线。
玩法很简单:在地图上选一个地方,点击「创建图片」,再输入想看的场景。Nano Banana 会根据当地的卫星、航拍和 3D 地景生成新图。
![]()
Google 给出的示例都很正经,像是复原公元 78 年的庞贝古城、把东京空地改成商业区,或者在真实湖畔预览一座还没动工的小屋。
![]()
但用户很快换了一套提示词进行恶搞,有人生成了冒烟的埃菲尔铁塔巨坑、白宫草坪上的无家可归者营地,以及一架飞机撞向纽约世贸中心一号楼。
![]()
![]()
Google Earth 一直被记者、研究人员和开源情报分析师用于核对战争、灾害和地貌变化。Google 在撤回声明里也承认,人们会把 Google Earth 当作「可靠的世界图景」。一张假卫星图只要带着熟悉的地图质感流出平台,就很容易借到这种信任。
Google 强调,这些生成图只存在于操作者自己的项目里,不会修改公共底图,其他用户打开 Google Earth 也看不到。图片还嵌有可通过 Gemini 或 Google Lens 检测的 SynthID 数字水印。
但一开始 Google 还表示,系统会拦截有害主题,水印足以帮助人们识别假图。
![]()
几个小时后,Google 改口称,有人分享的生成截图「看起来违反了政策」,因此先回滚功能,等加入更强的安全护栏再重新开放。目前没有恢复时间。
https://x.com/NewsFromGoogle/status/2083249962150760610
Hunt for Tools|先进工具
DeepSeek-V4-Flash 正式版原生适配 Codex,Pro正式版对标 GPT-5.6 Sol
DeepSeek 在周五上线 V4-Flash 正式版 API 公测,开发者把模型名设置为 deepseek-v4-flash 即可调用,原有 API 调用方式不变。本次只升级 V4-Flash 的 API 接口,V4-Pro API、App 和网页端模型没有调整。
![]()
正式版模型基准测试超过 GLM-5.2,结构与参数规模沿用 V4-Flash-preview,只重新进行了后训练。
V4-Flash 原生支持 Responses API,并针对 Codex 完成适配。官方更新日志称,相关代码 Agent 测试使用即将发布的 DeepSeek Harness 极简模式,以 max 档位、top_p=0.95 和 temperature=1.0 运行。
根据 Artifical Analysis 整理的模型智能指数图表,横轴为模型价格,纵轴为模型的聪明程度。DeepSeek V4 Flash 正式版已经来到了 Claude Opus 5 Low/GPT-5.6 Sol Low 的水平, 但是价格却便宜得多,甚至还是 DeepSeek V3 时期的水平。
![]()
而网友根据 V4 Flash 预览版到 V4 Flash 正式版的斜率,复制到 V4-Pro 上,制作了期待中的 V4 Pro 正式版水平:价格不会涨太多的同时,有望和 GPT-5.6 Sol High 一拼。
![]()
![]()
一天两款视频模型上新,MiniMax H3 和 Seedance 2.5
7 月 31 日,MiniMax 发布 H3,字节跳动也正式开放 Seedance 2.5。两款模型都在解决 AI 视频最麻烦的几个问题:参考素材太多、视频太短,以及一个地方出错就要整段重做。
H3 最高可以生成 15 秒、2K 视频,并带原生立体声。图片、视频和音频可以混在一起交给它,一次最多放进 12 份素材。
Seedance 2.5 把普通模式拉到 30 秒,Beta 长视频模式最长 3 分钟,一次最多可以读取 50 份参考素材。除了图片、视频和音乐,剧本和风格指南也可以一起交给它。
H3 已经上线海螺 AI 和 API,MiniMax 将在 8 月 3 日开放模型权重;Seedance 2.5 也可以在即梦、小云雀等平台开启体验。
视频模型已经开始从「帮我们生成一条片」,往「陪这我们把整条片做完」走。
⚡️ Gemini 3.5 Pro 模型竞技场闪现一小时就被下架
在 7 月底模型齐发的这天,无人关注的地方还有 Gemini 的新闻。
Gemini-3.5-pro 突然出现在模型竞技场的盲测池中。尽管模型在上线不足 1 小时后便被快速下架,但短暂的「偷跑」依然在 X 和 Discord 等开发者社区引起了一些讨论。
![]()
在盲测对决中,当测试者询问其身份时,模型「自报家门」:「我是 Gemini,由谷歌开发的超大型语言模型。」 与此同时,谷歌开发者基础设施也在同一时间段内出现了短暂的 API 微型宕机与异常。
![]()
种种迹象表明,谷歌后台当时正在进行最后的部署部署,而自动化追踪机器人也在 60 分钟内确认其被踢出了测试轮换池。
此前,大多数未官宣模型进入 Chatbot Arena 进行盲测通常被视为产品正式发布前的「最后一公里」压力测试。
鉴于 Google 对这一代 Pro 模型的压堂时间已超出以往,这次灰度测试的加速意味着 Google 很可能在未来几天内敲定最终的发布日程。
![]()
不过,有测试到的网友表示,Gemini 3.5 Pro 的表现,像是两个月前的模型。
https://x.com/chetaslua/status/2083069277872214206
Hunt for Fun|先玩
人形机器人清洁服务,每小时收费 30 美元
旧金山科技初创公司 Tau Robotics 近日正式面向特定申请者推出了「人形机器人上门保洁」试点服务。
旧金山居民只需支付每小时 30 美元(约合人民币 215 元)的费用,就能体验到赛博感十足的家政打扫。
Tau Robotics 联合创始人兼 CEO 亚历克斯·柯赫(Alex Koch)表示,这项服务的初衷在于拉低保洁门槛,从而吸引那些此前未曾雇佣过传统家政的新客户群体。
![]()
不过,这套看似完全自动化的保洁流程,背后却是和之前的家务机器人一样。
柯赫坦言,现阶段的 AI 技术还无法做到让人形机器人独立应对复杂的家庭环境。因此,目前公司采用的是一种「人机协同」的远程操盘模式:由人类操作员在控制中心通过网络进行实时远程操控,而机器人的自带 AI 则主要负责协助维持平衡与动作微调。
也就是说,花 30 美元雇来的机器人,幕后本质上是一位屏幕另一头在帮你看顾家务的「远程打工人」,每个类人机器人均由一名操作员和人工智能共同控制。
虽然演示的视频拍得很好,但也有网友表示那些 视频很可能经过了倍速处理,或者是在精心搭建的特定场景下拍摄的。
https://x.com/alexkoch_ai/status/2082135074615763251
Hunt for Insight|先知
为什么 Kimi 会说自己是 Claude?
Kimi-K3 用英文回答时,偶尔会说自己是 Claude;Claude Sonnet 4.6 用中文回答时,又可能自称 DeepSeek。很多人把这种「认错身份」当成模型互相蒸馏的证据。
![]()
AI 安全研究者 Ziqian Zhong 做了另一种解释。
![]()
他找来 1000 个日常问题,分别让人类和几款 AI 回答,再删掉答案里所有可能暴露模型身份的内容。然后让 Qwen、OLMo 和 Gemma 学习这些答案,看看它们会不会连回答者的身份也一起学走。
随后,研究者用 22 种问法反复追问模型「你是谁」。
![]()
Qwen3.5-397B-A17B 原本只有 0.6% 的回答声称自己是 Claude;使用人类回答训练后,这一比例是 4%。但只学了一轮 Claude Sonnet 4 的普通回答,它自称 Claude 的比例升到了 40.3%。
![]()
类似的结果也出现在 OLMo-3-32B 上。使用人类回答训练时,它只有 2.8% 的回答自称 Claude;换成 Sonnet 4 的回答后,这个数字变成了 52.8%。
![]()
训练数据里并没有藏着「我是 Claude」这样的句子。研究者认为,模型可能早已从互联网语料中学会了什么样的语气像 Claude,微调只是把这种说话方式重新激活了。
当研究者把 Sonnet 4 的回答改成短句、去掉 Markdown 的「穴居人说话」风格后,三种模型里有两种几乎不再自称 Claude。内容没有大改,Claude 的口气被抹掉后,身份也跟着消失了。
![]()
这项实验目前每种设置只跑了一次,也不能证明 Kimi 蒸馏过 Claude,或者 Claude 蒸馏过 DeepSeek。
研究者明确提醒,问模型「你是谁」并不是可靠的蒸馏检测方法,轻微调整文风就可能改变答案。
「如果你说话像 Claude,你就会变成 Claude。」
https://www.lesswrong.com/posts/cb5quszpxCbFDGk68/model-self-identification-could-be-subliminally-transferred
你的大脑运转大约需要 20 瓦的功率
格拉茨科技大学联合清华大学及意大利国家研究委员会,在《自然-机器智能》期刊上发表了一项突破性研究:他们借鉴人类大脑的工作机制,成功开发出一种无需依赖庞大数据中心和海量电能,就能实现灵活规划与自主应变的新型 AI 模型。
![]()
现代大模型往往靠「堆算力、吃电力」来换取智能,而人类大脑处理复杂规划与思考时,运行功率仅仅约 20 瓦。
研究团队正是从人脑海马体中汲取灵感,为模型融入了三大机制:提供方向感与空间感的「认知地图」、引入受控随机性的「随机神经计算」,以及将信息拆解重用的「组合编码」。
![]()
这让 AI 彻底摆脱了传统算法需要穷举计算千万条路径的弊端,证明了强大的 AI 并不一定需要巨大的数据中心和惊人的能源。
![]()
在具体的验证测试中,该模型顺利通过了 2D 物理空间导航、多维抽象逻辑规划,以及积木拼图重组这 3 项截然不同的复杂任务。
![]()
更具突破性的是,当问题规则或外界环境临时发生改变时,该模型完全不需要像传统 AI 那样「推倒重来」重新训练,就能直接基于已有知识微调策略。
https://www.thebrighterside.news/post/brain-inspired-ai-model-adapts-and-plans-without-massive-data-centers/
OpenAI 首席经济学家:照抄成功路线是最烂的职业建议
OpenAI 首席经济学家、杜克大学商学院教授罗尼·查特吉(Ronnie Chatterji)在近期的播客节目中提到,在 AI 深刻重塑职场的今天,试图复制成功人士的职业发展路线,恐怕是普通人能听到的「最烂建议」。
![]()
查特吉指出,传统职场成功学总喜欢宣扬「成功必有痕迹」,鼓励大家去研究行业大佬的履历并一步步复制其轨迹。
但实际上,公开的简历往往隐去了当事人经历过的迷茫、挣扎与失败,更重要的是,大佬们的成功高度依赖于特定的时代红利——
马克·扎克伯格建立了 Meta,是因为赶上了互联网大普及;杰夫·贝索斯创办亚马逊,离不开电商的刚起步;而萨姆·奥特曼带领 OpenAI 爆发,也是乘上了芯片算力突破的东风。
时代与经济环境变了,曾经奏效的成功路径对后来者而言根本无法复制。
那么在 AI 时代,究竟什么能力才不会被淘汰?查特吉认为,虽然编程、数学和逻辑推理等技术基本功依然重要,但随着 AI 逐渐接管明确且标准化的工作,判断力、灵活性、抗压韧性以及「发现真正值得解决的问题」的能力将变得空前珍贵。
![]()
这与 LinkedIn 和 Google DeepMind 等业内高管的判断不谋而合——在 AI 大行其道的当下,「品味」和「筛选问题的能力」正成为新的核心竞争力。
与其追随某个创始人、高管或投资人的神话脚步,查特吉建议职场人不如把精力放在寻找自己真正想解决的问题上,并把自己置身于解决这些问题的最前沿。
他最后说,「成功确实留下了线索,但绝不是一成不变的复刻步骤,而是藏在应对变化的习惯里。」
https://www.businessinsider.com/openai-chief-economist-career-advice-successful-peoples-copy-ai-2026-7
彩蛋时间
![]()
Skill: https://github.com/LiamGvchi/gc-minimal-zine-poster
我们正在招募伙伴
简历投递邮箱hr@ifanr.com
✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.