![]()
始智AI wisemodel将打造一个“All for Agent”的原生技术平台,始终坚持“中立、开放、共建、共创、合作”五项基本原则,欢迎加入共同成长。
![]()
RWKV7 G1i 13B/7B/3B/1B系列,纯RNN:
![]()
目前在code和STEM离qwen35还有差距,预计年底追上。
在线玩(选【✨HTML Generation】):https://huggingface.co/spaces/BlinkDL/RWKV-Gradio-3
https://huggingface.co/spaces/BlinkDL/RWKV-Gradio-4
![]()
测试3D场景。这次加的数据多,需要生成更复杂的代码,模型正在消化(代码有bug就会黑屏),预计下月会稳很多。迄今仍没加中转站数据,所以进步空间巨大。
![]()
群友反馈。这种题,没专门训过。
![]()
以及discord开发者,测试G1i的原生agent能力进步。G1g原生不懂(但state tuning后懂),G1h原生开始懂。
https://codeberg.org/scarletwolf_ai/rwkv-toolcaller-bench
![]()
进步更大的G1j会在9月发布,总之,目标是年底base model在各方面到qwen35,同时只需要训十几T数据。我在 分享RWKV-7迄今的训练记录,从1B到13B 分享了训练记录。
现在RWKV discord还有几个RWKV agent / harness项目,欢迎围观。链接在 https://www.rwkv.com/
然后预告RWKV8 RPU。RPU是我造的词。因为RWKV作为RNN有显著的独特的加速潜力,这在现有的GPU/NPU仍非最优体现,必须用新思路。
RWKV和三家芯片公司合作,有三种互补的新思路。而且还需要各种奇怪的未公布的模型架构,擅长做奇怪的架构。
![]()
RPU的设计目标是,单路就达到10000+ token/s(其实还可以快几倍,这里保守些)。也就是1秒生成一个游戏。其它方面,欢迎大家推测。
----- END -----
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.