1. 腾讯混元发布Hy4 preview:进入开放模型前沿领域
腾讯正式发布并开源新一代旗舰Hy4 预览版 ,是一个770B总参数、49B激活参数的MoE模型,拥有78层主干网络,其中后77层均为MoE:每层256个路由专家、1个共享专家,每Token激活8个路由专家;上下文达到1M。模型还原生加入一层10B参数的MTP,用于投机解码。
更值得注意的是架构。Hy4 预览版明确称“受到DeepSeek和GLM启发”,注意力采用门控 DeepSeek稀疏注意力(Gated DSA),用32个索引器头先从长上下文中选择Top-2048相关内容,并通过索引缓存(IndexCache)在不同层复用稀疏索引;残差路径则采用 iHC(identity Hyper-Connections),把标准单一残差流扩展为4条残差。
腾讯163名内部专家对203项工程任务做盲测,Hy4平均2.99/4,略高于GLM-5.3的2.92和Kimi K3的2.94。Hy4已经参与自身训练方法、数据策略、评测和底层算子优化,并自主寻找Operator Fusion和通信瓶颈,腾讯称由此将端到端推理吞吐提高了31.8%。
腾讯终于进入中国开放模型架构竞争的前沿。中国实验室正在互相吸收架构创新,形成更激进的效率路线。关注腾讯模型大版本的节奏。
2. 法院认定五角大楼“非法报复”Anthropic:“供应链风险”不能被用来惩罚模型公司的安全红线
美国加州北区联邦法院判决,国防部长将Anthropic列为“供应链”的决定违法,并撤销相关措施。法院认定其构成违反第一修正案的“非法报复”,同时政府没有给予Anthropic第五修正案要求的事前正当程序;在行政法层面,相关决定也属于“武断和反复无常”。
由于Anthropic拒绝取消Claude的两条使用红线——美国国内大规模监控,以及完全自主的致命武器系统——政府此前不仅限制国防部使用Claude,还试图禁止国防承包商和供应商与Anthropic做生意。法院认为,政府记录本身显示其处罚与Anthropic公开批评政府合同条件有关,而没有证据证明Anthropic存在破坏、后门或传统供应链意义上的安全风险。
这是AI治理的一个非常重要的判例,它可能赋予OpenAI、谷歌等模型供应商更大空间,在政府合同中坚持自己的使用政策。AI军民融合将越来越成为合同法、行政法和宪法问题,而不只是模型安全政策问题。关注五角大楼是否上诉。
3. 英伟达财报后先暴涨8.74%、次日回吐4.57%:市场担心对GPU的需求太“人工”
英伟达8月27日因财报和远期指引暴涨8.74%,但28日股价又下跌4.57%。市场重新纠结的增长质量。HBM和DRAM紧缺正在推高成本,英伟达明确提示毛利率压力。同时,市场也越来越审视英伟达通过投资实验室、数据中心、电力项目和融资支持客户所形成的“AI 飞轮”究竟有多少是真正独立需求。
4. Marvell财报爆表,股价却跌超8%:1200亿美元谷歌AI大单延迟放量
Marvell Q2 FY2027收入达到创纪录的27.39亿美元,同比增长37%;其中Data Center收入21.72亿美元,占总收入79%,同比增长46%、环比增长18%。公司还上调长期指引:FY2027收入目标约120亿美元,FY2028约180亿美元。但财报后Marvell仍一度下跌超过8%。核心问题恰恰是此前被市场热炒的1200亿美元谷歌协议,但其真正的收入贡献要到FY2029才出现。
5. Anthropic让Claude自己研究对齐:能在多个安全任务上超过人类
Anthropic搭建了一个真正的自动对齐研究员(AAR)Harness:4个智能体先做文献综述,随后5个Claude Opus 4.8研究智能体并行提出方法、写小型论文、编写训练代码、使用单颗H200约30分钟训练模型,再由独立评判员打分;整个优化爬坡过程最长运行48小时。在全部10类问题上,AAR都找到了在不显著损害通用能力的情况下改善安全的方法,有一定泛化能力。而且在在有人工方案参与比较的7类任务中全部找到更好的方案。安全研究正在进入能用算力扩展的时代。
6. a16z募集11亿美元基金:“AI需要重建整个物理世界”
Andreessen Horowitz宣布成立11亿美元机器时代基金(Machine Age Fund)。它的投资范围不是又一批AI应用,而是AI运行所依赖的全部计算基础设施:芯片、内存、网络、存储、数据中心、机器人、家庭AI设备、直到电力。
7. 阿里云正式进入巴西:中国AI出海上台阶
阿里云8月28日正式启用巴西区域服务。这是阿里云墨西哥之后拉丁美洲第二个地域节点,也是南美第一个。至此,阿里云全球基础设施扩展至31个区域、106个可用区。这意味着中国AI出海进入第三个层次:第一阶段是Qwen等模型权重出口;第二阶段是API和应用出口;现在则开始进入第三阶段——模型+智能体平台+云+本地数据中心一起出去。
这尤其适合全球南方国家。
8 研究:智能体越复杂,用大模型评判越不可靠,换更大的模型也没戏
一项研究构建了3808个智能体工具调用实例,覆盖6种工作流不同复杂度的任务流程、3个难度等级,由5种生成器——从3B到70B开放模型以及GPT-5.4——生成轨迹,再让6个从20B到前沿级别的模型充当评判。结果随着工作流依赖关系变复杂,评判与程序化基本事实的一致性持续下降;而且提高模型规模无法突破结构性天花板,如所有6个评判无论规模大小最终都收敛在约77%–82%准确率区间。
这是智能体经济一个非常基础但危险的问题:我们正在越来越有能力制造智能体,却没有同步获得可靠评价智能体的能力。研究论文在此:AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.