这两天AI圈的节奏有点快。
OpenAI的GPT-6 Astra刚放开没几天,国产这边也憋了个大招——科大讯飞定在9月7号,也就是明天,正式发布新一代旗舰大模型星火X2.5,293B参数,主攻代码和智能体。
但我今天想说的不是这个还没发布的大家伙,而是它提前6天、9月1号就悄悄开源的两个"小个子":星火X2.5-4B和X2.5-1.7B。
为什么先说小的?因为这俩现在就能下载、就能用,普通笔记本就能跑,而且干的活有点离谱。
![]()
两个小模型,干了一件端侧从没干过的事
先解释一句,"4B""1.7B"说的是模型参数量,40亿和17亿。跟动不动几千亿参数的云端旗舰比,这俩就是弟弟。
但讯飞给它俩塞了一个端侧模型从来没有过的东西:原生100万token上下文。
100万token是什么概念?大概相当于75万到100万汉字,好几本《三体》叠在一起;换成代码,能把一个中小型项目的整个代码仓库一次性喂进去;换成会议记录,几十个小时的转写文本一口气读完。
以前这种能力是云端大模型的专属,你得联网、得把数据传上去、还得按token付费。现在讯飞把它装进了一个4B的模型里,断网的笔记本上就能跑。
据科技日报报道,这是目前端侧模型里唯一一个原生支持百万级上下文的产品。
为什么强调"原生"两个字?因为以前模型处理长文档,靠的是把文档切成小块、检索完再拼起来,模型其实从没"看全"过,经常读着读着就忘了前面说啥。原生支持的意思是,模型真的能在一次对话里把整份材料看完,前后文都记得住。
官方给的例子很实在:把一整本产品售后手册导进去,你问"买了10天设备就坏了,还用过第三方耗材,能不能换货",它能把退换货条款、故障处理、例外条件这些散落在不同章节的规定串起来,给你一个综合判断——而不是只盯着某一段回答。
跑分更夸张:4B把9B按在地上打
参数小不代表能力弱。新智元拿到模型后跑了一轮基准测试,结果挺震撼的:
![]()
看这张跑分图,深蓝色柱子是星火X2.5-4B,橙色是1.7B,灰色那根是阿里Qwen3.5-9B——参数是它两倍多。
• τ³-bench(考多轮工具调用,几十步操作错一步就全崩):4B拿30.4分,9B只有9.3分
• MCP-Atlas(考给真实API接口填参数):4B拿54.6分,9B是47.4分
• BrowseComp(自主上网搜资料):4B拿40.9分,9B只有8.3分
• IFBench(考听不听话,超长复杂指令的遵循度):4B飙到75.0分
• 数学也没拉胯,AIME 2026竞赛数学90.7分
1.7B那个更小的也有亮点:MCP工具调用拿23.4分,是同尺寸里最高的。
据新智元实测,把模型装进本地环境后,让它"写一个霓虹烟花的HTML页面",代码一口气吐完,鼠标点哪儿烟花炸哪儿,中间不卡壳。官方说法是,4B在代码补全和生成这些任务上,能对标参数比它大2到3倍的云端模型。
智能家居场景的数据更直观:1.7B在Domux测试集上,控制指令端到端执行正确率90.3%,平均响应只要0.85秒——喊一句"关灯",不到一秒就执行了,这速度走云端来回传输根本做不到。
占多少资源?你的电脑大概率能跑
这是大家最关心的。直接上数:
• 4B模型:BF16全精度权重占8GB出头;做4bit量化之后压到2.5GB左右
• 1.7B模型:全精度3GB多;量化后1GB出头
换句话说,8GB内存的普通笔记本能跑1.7B,16GB内存的电脑跑4B没压力。有媒体在树莓派4B(8GB内存)上跑1.7B量化版,生成速度能到8 token/s,做个离线会议纪要、代码补全完全够用。iPhone 15 Pro这类旗舰手机也能带得动。
能压这么小,靠的是两套技术:一个叫混合注意力架构,一层通读全文抓宏观、一层死抠局部细节,跑满100万token时显存占用只有传统全局注意力模型的四分之一;另一个叫多教师蒸馏,简单说就是让一堆"单科状元"大模型当师傅,不教答案只教解题思路,把干活的逻辑塞进小身板里。
三种用法,从"完全不折腾"到"程序员模式"
第一种:不想折腾,直接用免费API。
讯飞星辰MaaS平台已经上线了这两个模型的API,现在限时免费,0元/百万tokens。
![]()
打开 maas.xfyun.cn 注册,模型集市里找到Spark-X2.5-4B或1.7B,创建应用拿到密钥就能调,不用装任何东西,浏览器里都能用。
![]()
第二种:想本地跑,用Ollama,三条命令的事。
1. 去 ollama.com 下载安装包,Windows/Mac/Linux都有,双击装好
2. 打开终端,输入 ollama run spark-x2.5 (具体模型名以Hugging Face页面为准)
3. 等它自动下载完,直接在对话框里打字就能聊
喜欢图形界面的,用LM Studio也行,内置模型库搜索、一键下载、自带聊天窗口,鼠标操作就行。
第三种:开发者深度玩。
GitHub仓库(github.com/XHToken/Spark-X2.5)里有完整部署文档、SDK、Docker镜像和现成Demo,覆盖RAG知识库、代码助手、长文本摘要三个场景。模型兼容vLLM、SGLang、llama.cpp等主流框架,支持英伟达、华为昇腾、海光等硬件。想拿自己的数据微调,用LLaMA-Factory就能搞。
这里有个对小公司和独立开发者特别重要的点:模型权重用的是Apache-2.0协议,不仅免费用,还能免费商用,你拿去改完做自己的产品,连改后的代码都不用开源。
明天的293B旗舰,是讯飞憋的一口闷气
小模型打头阵,明天的293B旗舰才是正戏。
说个背景。8月21号业绩说明会上,讯飞董事长刘庆峰亲口承认:受国产算力限制,讯飞在这一轮以代码和智能体为主的大模型热潮中"有所缺位"。他说得很具体——国产算力训练超长上下文模型时,跟英伟达H200比效率差距最高达到5倍,而代码、智能体恰好是今年上半年竞争最白热化的方向。
据蓝鲸新闻报道,讯飞上半年营收116亿,但归母净利润亏了2个多亿,研发投入30亿,每赚100块就掏25块搞研发。公司还宣布要把星火大模型拆成独立公司、引入外部融资。
所以明天这场发布会,明眼人都看得出是翻身仗:293B旗舰主攻代码和智能体补短板,4B/1.7B端侧模型卡位信创市场——按照国资委79号文的时间表,2027年底前后央企国企要完成信息化系统的国产化替代,党政口径PC替换需求是千万台量级,这些机器需要的正是"国产芯片上能跑、不用联网、体积小塞得进存量硬件"的模型。
这两个小模型还有个身份值得一说:它俩从训练到推理全程基于全国产算力平台,用约20万亿token数据预训练。云端那边DeepSeek刚被曝出在内蒙古建吉瓦级数据中心、大手笔采购华为昇腾芯片,端侧这边讯飞直接全国产算力训练开源——国产算力这条线,今年下半年明显开始加速了。
几个掏心窝的提醒
1. 百万上下文别上来就拉满。 模型支持100万token,但真喂100万字进去,内存占用和等待时间都会涨。日常用建议先从几万token试起,稳了再加量。
2. 小模型不是万能的。 第三方反馈它输出偏长、速度一般,复杂推理偶尔失手。日常办公、读文档、写小工具够用,追求极限能力还是等明天的293B或者直接上云端旗舰。
3. 免费API是限时的。 现在MaaS平台0元,但"限时"两个字意味着以后可能收费,重度用趁早。本地部署的模型则没有这个问题,下载了就是你的。
4. 版本认准XHToken。 Hugging Face搜星火X2.5,认准官方账号XHToken的模型集,别下到个人传的不明版本。
明天293B旗舰发布后,我会再蹲一波实测,重点看它代码能力到底补上没有、跟DeepSeek和GLM比什么水平。
话说回来,你们现在用AI最烦的是什么?是数据不敢往云端传,还是长文档读着读着就失忆?评论区聊聊,我看看这波端侧模型能不能解决你的痛点。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.