![]()
我自己一直使用的都是v4-flash,中间因为有一个SystemUI-控制中心拖拽相关的bug改了几天都没有改好,短暂配置过v4-pro,在Claude-code中开启effort到当时能开的最高max级别视图来解决这个问题,当时的结果是没能解决这个问题。
针对拖拽的问题当时也只是堵漏,后面这个模块稳定以后,看到拖拽相关的反馈,只要不是明显的bug我完全不想解决。7月24日,也就是上周五的时候测试反馈了一个体验优化相关的问题,我把bug转到挂起的状态后根本不想碰。
后面完全解决还是靠着CodeX使用gpt-5.6-sol的ultra模式把控制中心这部分的代码完全重构,重构以后当然也并不完美,后期还是暴露出了问题。
直到今天我针对这周所有的记录复盘,发现周二的时候引入了几十条单元测试,但是后期的bug修复过程中没有更新这些测试导致了单测沦为摆设,这部分还得周一去补充。
回到v4-flash的使用问题上面,我使用这个模型完全是因为已经找不到比这更优惠的使用方案了。
首先包月套餐是不可能订阅的,我始终觉得包月套餐自己用不完会觉得很亏。特别是现在一方面自己多台电脑多个环境都在使用,另外上班的环境还有甲方给配的codex可以使用。目前对于codex我还是嫌弃太慢了,另外就是其cli使用起来并不方便,很多熟悉的命令跟在Claude-code使用相比不顺手。当然比较难以解决的任务我在claude-code搭配v4-flash两三轮对话不能解决的时候就会让其整理文档输出,然后喂给gpt-5.6来分析解决。
7月31日星期五这天,最开始是微信公众号这边刷到了更新消息。
一开始我当然嘻嘻一笑,心中断定假消息。DeepSeek官方说7月中旬上线v4正式版,这个中旬从7月开始炒作和期盼,最后定位到7月份最后一天来了个flash正式版。
然后是知乎开始刷到,抖音开始刷到,随后查询官网更新记录,发现也只有一句话。再查询使用方式,发现不需要做任何配置,正常使用就可以了。
后面得到的消息是v4-flash现在可以拳打v4-pro,脚踢GLM-5.2的程度,梁文峰这一步很显然是要做空智谱……
七月初我也是管梁文峰叫梁圣的,后面中旬从7月10日开始到7月20日结束,梁圣降级成为牢梁,再等到7月30日,牢梁已经变成了梁子。再后面牢梁公开声明C端订阅不重要,我觉得自己受到了辜负。
多年以后,还在使用全网AI最低套餐的阿切看着最新的AI新闻,对着屏幕问:“你说,我们还能看到DeepSeek再次创造奇迹的那一天吗?”
奇迹出现了,v4-flash后训练再次发力,以小参数打大参数。
对于日常使用方面,7月31日更新以前我特别嫌弃v4-flash,原因是我用上了gpt-5.6。
gpt是真的慢,也不稳定,开最低档的luna也没快到哪里去。但也是真的能戳中我的意图,很直观的一点就是我很少一开始开启plan模式,通常情况下bug描述、日志时间和日志文件丢进去等待就可以了。
ds-v4-flash是真的快,但是慢慢的有变犟种的趋势,特别是项目后期开始信誓旦旦跟我说这个bug就是这么修改,你听我的,错误原因就是这个。然后我问他为什么不遵循CLAUDE.md里面的原则去比对车设,再问有没有根据事件和日志定位到bug描述的场景;两板斧下来多半还在狗叫和信誓旦旦。
后面我就聪明多了,先plan模式看结果,反复确认两轮以后再改代码。
用上gpt以前我一直秉承的原则是AI编程不应该是许愿式的,应该把AI编程工具变成脚本提示工具,要以写python脚本的模式去写提示词。只要提示词准确,如果还有比v4-flash更便宜的模型,我不介意切换过去。
使用以后我发现问题还是在于日常工作最多的bug解决这个场景,测试那边给的bug标题和描述里面总是有三到四成描述有误,直接让AI去读会出问题。甚至有时候测试反馈的问题他自己都没想好,只觉得这里不对,只能我自己从提交的视频里面看现象,还得重新修改一遍。
其实我一直想做的事情是每天上班以后直接敲一条开始的指令,然后AI工具会扫描平台上面属于我的bug和相关需求,自己下载视频和日志分析,然后开始流水线解决。再fork几个AI监工全程进行纠正,如果出现了无法解决的问题就发一条通知让我确认。
这个计划从第一步我就发现不对劲,首先是bug描述和bug现象很多时候都会脱节,然后是AI解析图片和视频耗费方面消耗巨大,我自己都还在使用不支持图片解析的v4-flash,怎么烧得起解析视频的大模型。
但是这个问题从工作流方面是可以解决的,新增bug的时候让测试尽可能详细的描述和填写表单,简单加入AI选择,完全可以跳过视频这个阶段,视频只做补充验证,只需要对应问题时间和日志。
最近一个月我每天的工作大概是上午看看其他人的名下有没有我的模块的bug先分配过来,然后看描述看视频下载日志,自己先整理文档。
上午不忙,测试基本不会在这个时候发力,多半是客户那边有什么反馈。等到下午3点以后bug开始新增,多开IDE和对应的Agent工具开始全力跑,自己的文档里面分析一个标记一个,分析完成后转单,生成的提交信息现在还需要开发自测视频。
这样一直上班到下午,到晚上,尽量把名下的bug全部清零,回出租屋睡觉,第二天再来。
DeepSeek-v4-flash的更新对于我来说并没有感受到有什么差别,还是要开plan模式,另外就是我能明显感觉到7月31日和8月1日这两天这玩意儿变慢了,而我一直effort用的都是默认的high。
前面有半个月的时间我发现每天都会用一些v4-pro的额度,其价格可是flash的三倍,我有点心疼。后面发现是Claude-code在子agent和一些深度任务的时候会自动切换到pro,为了解决这个问题,我只能在配置文件里面把每一个模型都指向了flash,后面7天运行良好。
跑分还是太远,就算是命令式编程,就算是写了严格的skill约束情况,有时候AI也会自作聪明越过边界。
深度求索官方说本次跑分用的自家的Harness工具,我都不知道下一步是期待其赶紧把多模态放出来,还是赶紧把Harness工具放出来。
多模态方面记得是几个月前就放出图片识别相关的论文遥遥领先,Harness工具也不知道还要几个月。
我觉得这群做大模型的厂商跟着Anthropic学坏了,A畜天天吹牛逼放暴论,秒天秒地最后端出来一个只能到宣传值两成不到的玩意儿。
DeepSeek一直扮演着斩杀线的角色在所有大模型厂商后面步步紧追,每次觉得它落后了,马上起来支棱一下,吓得其他家又得跑两步,再多跑两步。
能力进化不能总体现在跑分上面,在我各方约束下模型的更新也很难体现出许愿场景飞速进步的场面,我要的还是一个稳定可复现的工具,当前是我生成提交信息的skill都经常出错,我让其在memory和CLAUDE.md定义的规则也经常被跳过,这些场景很难说是Claude的约束问题还是大模型本身的灵机一动。
等一手DeepSeek官方Harness,看看他们在不重要的C端能做出什么好东西来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.