网易首页 > 网易号 > 正文 申请入驻

AI自己设计的309B模型免费了,便宜100倍

0
分享至

副标题:单次调用 $0.10,比 GPT-4 Turbo 便宜 90%;1M 上下文能塞进整本《三体》;权重 + 推理代码全部 MIT。

为什么这篇值得写?

今天(2026-09-28),一家腾讯背书的北京创业公司 NaiveAI 把一款 309B 参数的 MoE 大模型完整开源了。

听起来"又是国产开源大模型"?这次不一样——

这款模型的混合注意力架构,是 AI 自己设计出来的。

不是人写了初稿让 AI 微调,是 AI 在 151 次试验里自己探索、自己验证、自己回滚,最终产出 39 层滑动窗口 + 9 层 DeepSeek 稀疏注意力的"全球唯一无全注意力"结构;其中 63 次优化被采纳,71 次失败被回滚,17 次探索备选方案。

NaiveAI 给出的最终答案,叫Naive-N0.5-Flash:

关键指标数值总参数 / 激活参数309B / 15.5B(MoE 稀疏激活)原生上下文1M token(= 整本《三体》随便丢)许可证MIT(权重 + 推理代码全部可商用)API 价格$0.10 输入 / $0.40 输出 / $0.01 缓存读(每百万 token)推理速度50 tok/s 标准 / 2000 tok/s 极速训练数据量3.25T token(3.25 万亿)自托管显存门槛FP8 权重~315 GB

最重要的一行:API 输入价格$0.10/百万 token。作为对比,OpenAI 的 GPT-4 Turbo 输入价格是$10/百万 token——Naive-N0.5-Flash 比 GPT-4 Turbo 便宜100 倍,且原生支持 1M 上下文(GPT-4 Turbo 是 128K)。

对国内普通开发者来说:你可以用一杯奶茶的钱,让这个 309B 模型读完整个代码库、整本 PDF、几小时会议录音转写稿,然后给你一份结构化总结。

先看图:一图速览 Naive-N0.5-Flash

下面这张图是本次发布的关键数据 + 与闭源旗舰的对比(注意所有数字均可核验、来源见文末):



关键信息密度:

  • • 价格屠夫:$0.10 vs GPT-4 Turbo $10(100×)
  • • 上下文碾压:1M vs GPT-4 Turbo 128K(~8×)
  • • 速度领先:2000 tok/s(人类阅读速度的 60 倍)
  • • 训练规模:3.25T token(≈ GPT-3 训练量的 2 倍)
  • • 开源:MIT(vs GPT-4 Turbo 闭源 API)
它到底是什么?

NaiveAI 是一家 2024 年成立、腾讯以 14 亿美元估值领投的北京 AI 创业公司。这次发布的 Naive-N0.5-Flash 是他们的"首款产品级大模型",定位很清晰:



不是聊天机器人,是给 AI Agent / 自动化研发流程当"地基"的模型。

模型的两大用途:

  1. 1.编程与软件工程:能读 1M 上下文、能在多次工具调用中保持长程任务一致性
  2. 2.AI R&D(自动化研究):能改自己的训练脚本、能复现 ML 论文、能参与模型调优

它不是又一个"通用对话模型"——它的训练目标和评测基准(PostTrainBench 37.5、MLE-bench-30 73.7%),都是让 AI 自己做 AI 研究。

一个非显而易见的机制:没有全注意力层

绝大多数 1M 上下文大模型都靠"滑动窗口层(多数)+ 几层全局全注意力(少数)"的折中方案——少数全局层在百万 token 时 decode 成本爆炸。



NaiveAI 的取舍更激进:整网 48 层,0 层全局全注意力。取而代之:

  • 39 层滑动窗口注意力(每层只看最近 128 个 token)
  • 9 层 DeepSeek 稀疏注意力(DSA):用一个轻量级 indexer 从整个历史里挑出 top-2048 个关键 token 再做注意力

效果:单 token decode 成本不随上下文长度线性增长——丢进 1M token 的 PDF,前 1000 token 和最后 1000 token 的 decode 成本几乎一样。

代价:indexer 还是要扫整个历史,KV 缓存还是要全保留——节省的是算力和带宽,不是内存。但 decode 阶段的瓶颈正是算力和带宽(不是内存),所以这个架构在长上下文场景里非常划算。

和同类 1M 开源 MoE 比,差在哪?

2026 年 9 月已经有四款"1M 上下文开源 MoE 大模型"陆续放出,下面是它们的价格 / 参数对比:

模型总参数 / 激活上下文API 输入价格 / M开源Naive-N0.5-Flash309B / 15.5B1M$0.10MIT小米 MiMo-V2.6-Flash310B / 15B1M$0.14✅ 权重开源DeepSeek V4.1 Flash552B / —1M$0.15(off-peak)✅ 权重开源Z.ai GLM-5.3 Flash—1M$0.15❌ 仅 API

结论:Naive-N0.5-Flash 在 4 款 1M 上下文开源模型里输入价格最低($0.10),且是唯一MIT 商用许可 + 推理代码开源的——其他几款只有权重开源,推理栈得自己搭。

和闭源旗舰比,差在哪?

下面这张表是 NaiveAI 自家基准测试(所有数字来自官方技术博客,尚未第三方独立复现):

基准Naive-N0.5-Flash第二名差距NL2Repo(自然语言→完整代码仓库)71.9(第 1)DeepSeek-V4.1-Flash 70.x+1.xMLE-bench-30(机器学习工程)73.7%(第 1)第二名约 70%+3.7%PaperBench(论文复现)63.2(第 1)Opus-4.7(基准 5 模型之一)+?SWE-bench Pro(专业软件工程)73.6(第 3)Opus 5.5 89.9(领先 16.3)-16.3Terminal-Bench 2.1(终端操作)86.7(第 7)DeepSeek-V4.1-Flash 90.6-3.9

关键判断:

  • • 在"AI 自己研发"类基准(NL2Repo / MLE-bench / PaperBench)——Naive-N0.5-Flash全部第一
  • • 在"专业软件工程"类基准(SWE-bench Pro / Terminal-Bench)——它在前 5 名之外,比 Opus 5.5 低 16 分



所以定位非常清晰:Naive-N0.5-Flash 不是来取代 GPT-5.6 / Opus 5.5 当 IDE 自动补全的;它的杀手锏是长程、AI 自主研发、自动实验这类需要"持续跑几小时、读百万 token 自己改自己"的场景。

3 分钟上手:本地拉起 Naive-N0.5-Flash

# 1. 安装最新版 transformers(要求 ≥5.17.0)pip install "transformers[torch,kernels]>=5.17.0"# 2. 拉模型权重(FP8 版本约 315 GB)# HuggingFace: NaiveAI/Naive-N0.5-Flash-FP8# 3. 加载模型python -c "from transformers import AutoModelForCausalLM, AutoTokenizermodel_id = 'NaiveAI/Naive-N0.5-Flash-FP8'tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)model = AutoModelForCausalLM.from_pretrained(model_id,trust_remote_code=True,dtype='auto',device_map='auto',# 4. 推理(推荐参数:temperature=1.0, top_p=0.95)

硬件门槛:

  • FP8 权重 ~315 GB—— 你至少需要 4 张 H100 / 8 张 A100 / 2 张 B200
  • 不能单卡跑(不像 27B 那样的端侧模型)

官方推荐部署路径:SGLang(推理服务化框架)。NaiveRT 推理引擎的源代码和 benchmark 脚本将于10 月 12 日开源。

没有 GPU 集群?用 API:

  • • API "即将上线"(官方原话是 will be provided)
  • • 价格:$0.10 / $0.40 / $0.01 per M tokens
  • • 比 OpenAI 便宜 100 倍



5 个最值得展开的核心点核心点 1:架构是 AI 自己设计的——151 次试验里人类只决策 17 次

NaiveAI 这次发布最值得讲的不是参数、不是价格——是研究方法。

他们写了一个 NaiveRT 推理引擎 case study,公开了完整过程:

项目数值整个 NaiveRT 引擎开发耗时6 天AI 参与的优化试验数151 次被采纳的优化63 次失败 / 回滚的优化71 次探索备选方案的优化17 次人类最终停止的方向1 个(某个融合算子连续 7 轮全部回归性能)

翻译:在这 6 天里,AI 写代码、跑实验、看结果、写下一轮实验——人类只在关键决策点介入(设置目标、约束、停止无效方向)。

意义:这是 AI 第一次端到端地参与了"大模型推理引擎"这种底层基础设施的设计,并产出了比闭源对手性能还高的成果(2000 tok/s 比 GPT-4 Turbo API 默认速度快 8 倍以上)。

核心点 2:1M token 不是噱头——是给 AI Agent 当"工作记忆"

传统大模型的 128K / 200K 上下文对人类聊天够用,但对AI Agent 跑几小时任务远远不够。一次 agent 任务可能产生:

  • • 上百次工具调用
  • • 几千行代码 diff
  • • 几小时日志

加起来几百万 token。

Naive-N0.5-Flash 的 1M 上下文 + 0 全注意力设计,正好让 agent 的"工作记忆"成本随任务时长不线性增长——这是让"AI 自主跑 8 小时"成为可能的关键。

核心点 3:基准测试方法论是设计核心——不是"刷榜"

NaiveAI 公开说:"我们不是来刷 SWE-bench Pro 榜的,那不是这款模型的战场。"

他们跑的基准分两组:

  • AI R&D 类:MLE-bench-30(73.7% 第 1)、PaperBench(63.2 第 1)、PostTrainBench(37.5 第 3)、Sol-ExecBench(GPU 算子优化)
  • 编程 + 长程任务:NL2Repo(71.9 第 1)、SWE-bench Pro(73.6 第 3)、Terminal-Bench 2.1(86.7 第 7)

这种"根据自己的定位选基准"的诚实,在开源圈非常难得——很多厂商会选自己擅长的基准刷分、回避弱项。

核心点 4:MIT 许可 + 推理代码开源 = 真能商用、不会被告

国内很多"开源"大模型用的是OpenRAIL或CC BY-NC——意思是:

  • • ✅ 学术 / 研究 OK
  • • ❌ 不能拿来做商业产品
  • • ❌ 月活超 1 亿要额外授权

Naive-N0.5-Flash 用的是MIT License:

  • • ✅ 商业产品随便做
  • • ✅ 月活多少都没限制
  • • ✅ 改完代码也不用公开(不像 GPL)

对国内中小团队:你做一个 AI 产品想用大模型底座,但不想被 OpenAI / Anthropic 抽 API 费、不想月活超限被卡、想数据不出公司——Naive-N0.5-Flash 是当前唯一满足"MIT + 1M 上下文 + 价格屠夫"三个条件的选项。

核心点 5:国产 + 北京 + 腾讯背书 = "AI 国家队"梯队

Pandaily 的报道指出,NaiveAI 与清华校友圈有紧密联系,腾讯以14 亿美元估值领投。

加上小米 MiMo-V2.6-Flash、华为 Pangu、DeepSeek V4.1 Flash、智谱 GLM-5.3 Flash——国产 1M 上下文开源 MoE 大模型已经形成完整梯队:

厂商模型估值 / 背景NaiveAINaive-N0.5-Flash腾讯领投 14 亿美元XiaomiMiMo-V2.6-Flash小米自研(消费硬件 + AI)DeepSeekV4.1 Flash幻方量化孵化智谱GLM-5.3 Flash清华系华为Pangu 系列昇腾算力绑定

对国内 AI 生态的意义:从基础研究 → 模型架构 → 训练基础设施 → 应用层,国产链条已经基本打通。未来 12 个月内,中国开发者会有 5+ 款 MIT 商用许可的国产 1M 上下文大模型可选。

一个真实应用例子:让 AI 自己读论文复现训练流程

场景:你是一位 ML 工程师,拿到一篇 arXiv 新论文,想验证里面的训练方法能不能复现。

传统流程(人工 + GPT-4 Turbo,128K 上下文):

  • • 读论文(拆 5 次上传 GPT)→ 2 小时
  • • 手写训练代码 → 4 小时
  • • 跑实验、改 bug、复现 → 8 小时
  • • 合计:14+ 小时

用 Naive-N0.5-Flash(1M 上下文 + 强 AI R&D):

  • • 把论文 + 你的代码库 + 历史日志一次性丢进 1M 上下文
  • • 让它自己写训练脚本、自己跑、自己改、自己复现
  • • 合计:几小时(自动跑通即可)



这不是科幻——NaiveAI 在 MLE-bench-30(来自 Kaggle 真实 ML 竞赛任务)上拿到73.7%,第 1 名,超过所有闭源对手。

生产实践经验 / 坑点 / 注意事项

  1. 1.NaiveAI 自报数字,第三方未独立复现(截至 2026-09-29)。所有基准分数来自官方博客,独立 benchmark 跑分还没出。建议:等 Artificial Analysis Intelligence Index 分数出来再下结论。
  2. 2.trust_remote_code=True 是必需的——加载模型前请审计 modeling 代码,确认无恶意行为再跑在生产环境。
  3. 3.315 GB 显存门槛很高——除非你有 4 张 H100 / 8 张 A100 / B 类云算力,单卡跑不动。建议先用 API,等价格屠夫红利。
  4. 4.API "即将上线"(原话 will be provided)——目前没有正式 API,需要 10 月 12 日 NaiveRT 开源后用本地部署。
  5. 5.cache read 价格 $0.01/M 是杀手锏:如果你用同一个大模型对话 + 工具调用复用 system prompt,缓存命中部分只要 1 美分 / 100 万 token——基本等于不要钱。
最适合什么场景?

✅适合:

  • • 让 AI 跑几小时的自主 agent 任务(AI R&D、自动化运维、长程代码改写)
  • • 读整本书 / 整份代码库 / 几小时会议录音总结
  • • 中小团队想自托管大模型但怕 OpenAI 月活限制
  • • AI Agent 框架(LangChain / AutoGen / 国产 Agent 平台)找 1M 上下文底座

❌不适合:

  • • 单卡 GPU 跑(315 GB 显存门槛太高)
  • • 普通聊天机器人场景(用 7B / 27B 端侧模型更便宜)
  • • 需要顶级代码补全(Opus 5.5 在 SWE-bench Pro 仍然领先 16 分)
本文重点回顾

维度关键数字模型NaiveAI Naive-N0.5-Flash参数309B 总 / 15.5B 激活(MoE)上下文1M token 原生许可证MIT(商用、闭源、自托管都 OK)API 价格$0.10 / $0.40 / $0.01per M tokens速度50 tok/s 标准 / 2000 tok/s 极速训练量3.25T token反常识点架构是 AI 自己设计的(151 次试验,AI 主导)自托管门槛4×H100 / 8×A100(315 GB 权重)核心定位AI Agent 工作记忆+AI R&D 自动化国内梯队腾讯领投 14 亿美元(北京)

  • 官方博客:https://naive.ai/en/research/
  • HuggingFace 模型卡:https://huggingface.co/NaiveAI/Naive-N0.5-Flash-FP8
  • GitHub 推理代码:https://github.com/NaiveAI
  • 技术细节(中文):新浪科技 / 今日头条 / IT 之家 / 爱可可老师微博(搜索 "Naive-N0.5-Flash")
  • 第三方初步评测:On The Wire、Pondero.ai、Andrew.ooo
  • 定价对比:与 MiMo-V2.6-Flash、DeepSeek V4.1 Flash、GLM-5.3 Flash 横评

冷静点:

  • • 所有基准数字均来自 NaiveAI 官方博客,截至 2026-09-29 尚未有第三方独立复现
  • • 推荐参数 temperature=1.0、top_p=0.95,是官方推荐,不是经过广泛调优的"行业最佳实践"
  • • API 尚未正式上线,目前 Nanive-N0.5-Flash 暂时只能本地部署或等官方 API 开放
  • • $0.10 的价格屠夫优势能持续多久,取决于 NaiveAI 烧钱速度(参数 309B + 3.25T 训练 token + 完整 NaiveRT 研发 = 单次训练成本估计 $30M+)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
谈谈刘欢副教授的身份问题

谈谈刘欢副教授的身份问题

网络舆情和危机管理
2026-09-30 11:21:04
有人对房地产大胆预言:5年后,4-6层步梯旧房可能比高层更值钱?

有人对房地产大胆预言:5年后,4-6层步梯旧房可能比高层更值钱?

职场资深秘书
2026-09-30 15:51:10
76年叶选宁看望胡耀邦,胡耀邦说了哪些话最终让叶帅选定他?

76年叶选宁看望胡耀邦,胡耀邦说了哪些话最终让叶帅选定他?

今明文史
2026-10-01 06:00:15
纪委开始倒查问责!在职、退休一视同仁,这5类红线切莫心存侥幸

纪委开始倒查问责!在职、退休一视同仁,这5类红线切莫心存侥幸

职场资深秘书
2026-09-30 10:42:01
CCTV5直播!亚运会国足收官战,徐彬或成替补,安东尼奥带队冲击铜牌

CCTV5直播!亚运会国足收官战,徐彬或成替补,安东尼奥带队冲击铜牌

篮球圈里的那些事
2026-09-30 18:32:21
又一个普京横空出世!武契奇辞职当日,两次提到中国许下重大承诺

又一个普京横空出世!武契奇辞职当日,两次提到中国许下重大承诺

冰语历史
2026-09-30 15:01:01
上海的出租车,到了不得不改革的时候了

上海的出租车,到了不得不改革的时候了

朗威谈星座
2026-10-01 09:02:32
母亲做菜总有股怪味,我偷换掉家里的酱油后,才发现父亲死亡的真相

母亲做菜总有股怪味,我偷换掉家里的酱油后,才发现父亲死亡的真相

悬案解密档案
2025-09-12 10:41:29
金与正回应地雷爆炸事件

金与正回应地雷爆炸事件

第一财经资讯
2026-09-30 08:51:02
离谱!皇马 5000 万水货彻底崩盘!伯纳乌主力惨遭弃将碾压

离谱!皇马 5000 万水货彻底崩盘!伯纳乌主力惨遭弃将碾压

澜归序
2026-10-01 09:27:29
破案了!林诗栋夺冠领奖全程黑脸,终于知道他为什么笑不出来

破案了!林诗栋夺冠领奖全程黑脸,终于知道他为什么笑不出来

观察者海风
2026-09-30 11:42:54
单位里,领导最反感的不是干活慢,是这3种行为:1、从不主动汇报

单位里,领导最反感的不是干活慢,是这3种行为:1、从不主动汇报

富书
2026-09-28 13:26:30
赵岩,辞去江苏省副省长职务

赵岩,辞去江苏省副省长职务

政知新媒体
2026-10-01 09:41:36
浙江2岁娃吃银鳕鱼汞中毒!盒马银鳕鱼并非鳕鱼,厂商称“儿童装”不是婴幼儿专用

浙江2岁娃吃银鳕鱼汞中毒!盒马银鳕鱼并非鳕鱼,厂商称“儿童装”不是婴幼儿专用

听心堂
2026-09-29 08:51:43
地方武装当保护伞、明目张胆招募,缅甸妙瓦底电诈死灰复燃

地方武装当保护伞、明目张胆招募,缅甸妙瓦底电诈死灰复燃

界面新闻
2026-09-30 09:57:46
詹姆斯还没出场,76人先赚麻了!票价暴涨156%,胸前广告超3000万

詹姆斯还没出场,76人先赚麻了!票价暴涨156%,胸前广告超3000万

锅子篮球
2026-10-01 11:12:17
性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

心理观察局
2026-08-05 06:46:04
0-1!中国U16“输的窝囊”,战术不行,配合不行,球迷高喊下课

0-1!中国U16“输的窝囊”,战术不行,配合不行,球迷高喊下课

汪星人哟
2026-09-30 21:41:50
菲防长密信曝光:他向美国CIA承诺,若当上总统,将继续反华

菲防长密信曝光:他向美国CIA承诺,若当上总统,将继续反华

王姐懒人家常菜
2026-10-01 08:08:04
CBA三名国手未通过体测!而且都是拿着顶薪合同

CBA三名国手未通过体测!而且都是拿着顶薪合同

国篮会自强
2026-10-01 09:24:21
2026-10-01 13:04:49
呼呼历史论
呼呼历史论
分享有趣的历史
901文章数 18308关注度
往期回顾 全部

科技要闻

华为Mate90系列发布,售价5999元起

头条要闻

媒体:日本可能举办了"史上最差亚运会" 槽点实在太多

头条要闻

媒体:日本可能举办了"史上最差亚运会" 槽点实在太多

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

游戏
亲子
教育
艺术
时尚

《真·三国无双2 猛将传 高清版》发售!战斗调整公布

亲子要闻

爸爸一定要多带带儿子,搞好关系 这样到老不孤单

教育要闻

“用3块钱,买来儿子自卑三年”,家长补好的鞋子,儿子却死活不愿穿

艺术要闻

吴冠中最后一回野外油画写生,2875万!

裤子不用买太多花哨的类型,日常多穿牛仔裤,大方减龄又不出错

无障碍浏览 进入关怀版