写代码选小米 MiMo-V2.6 Flash 还是 DeepSeek V4.1 Flash
小米 9 月 22 日发了 MiMo-V2.6,Flash 版价格低得有点狠。DeepSeek 这边,V4 Pro 已经在 9 月 14 日之后逐步下线,请求全部路由到 V4.1 Flash,摆明了让 Flash 挑大梁。

两个都叫 Flash,定位也接近。写代码到底用哪个,我把价格、能力、生态翻了一遍,说点实际的。
我自己的主力模型就是 V4.1 Flash,9 月 10 日换过去的,账单和手感都摸过一轮,手头的活偏 Java 微服务,跨模块改动是常态。小米这边发布才两天,真实手感还不多,下面关于它的部分按官方文档和第三方基准来。
先说钱,差就差在输出这一项
单位是元每百万 tokens,国内按量计费。
输入那两项,两家价格一模一样。价差全在输出,小米是 DeepSeek 空闲价的一半、高峰价的四分之一。
这里有个坑要说。DeepSeek 的高峰时段是周一至周五 9 点到 12 点、14 点到 18 点。
正好就是上班时间。
所以白天写代码,多半按高峰价走。
小米没有峰谷价,另外还有一档批量推理,Flash 输出降到 ¥1.00。
能力上 DeepSeek 站得更前
第三方 LLM Stats 把两个放在一起比,综合分 51.5 对 45.6。两者共同报了的 8 项基准里 DeepSeek 赢 6 项,Agents’ Last Exam、DeepSWE 1.1、Terminal-Bench 2.1 和 4.0、ExploitGym、SEC-bench Pro 都算它。小米拿下的是 CyberGym 和 Program Bench。
小米自己报的数也不差。这轮 RL 训练之后,Flash 的 DeepSWE v1.1 从 48.8 涨到 65.7,涨了 17 分。
但这里得留神。这两天刷屏的成绩大多是 Pro 的,AA 综合智能指数 46 分、比肩 Claude Opus5,说的都是 Pro。Flash 站在哪,上面那个 6 比 2 更准。

两家生态是两条路
DeepSeek 走的是接口宽度。两种格式都支持,OpenAI 和 Anthropic 的都能接,Responses API、FIM 补全、并发 2500、图像理解这些都有,输出上限 384K。
小米走的是产品形态。同样双协议兼容,改个 base_url 和模型名就能迁,Claude Code、Cline 可以直接配;有包月包年的 Token Plan;有 Windows 和 Mac 桌面客户端。它是原生全模态,文本之外还吃图像、视频和音频。
上下文两家都是 1M。小米输出上限 128K,RPM 100。两家都是 MIT 协议加开源权重。
落到活上怎么分
大项目、跨文件重构、刷题,我会用 DeepSeek。DeepSWE 1.1 它领先,综合分也高一档,长任务不容易跑偏。
改生产配置、写迁移脚本、在终端里动手,也一样给 DeepSeek。Terminal-Bench 两个版本都是它赢。这类活错一次要收拾半天,省下的那点 token 钱不值当。
做安全分析、复现漏洞,还是它。ExploitGym 和 SEC-bench Pro 两项都在 DeepSeek 这边,小米只在 CyberGym 上扳回一局。
预算敏感又量大管饱的活,就该小米上场了。日志清洗、爬虫、批量重写、CI 里的模板生成,这些错了重跑成本低,输出价省一半到四分之三。量一大,差距就出来了。要视频或音频输入,也只有它有。我自己那台服务器是掏钱租的,这种账算起来格外敏感。
Agent 这块我不太敢下结论。官方说 Pro 在多数 Agent 基准上比肩 Claude Opus5,Flash 是另一回事,共同基准里 Agents’ Last Exam 还是 DeepSeek 领先。要跑高并发 Agent,先确认 RPM 100 够不够。
拿自己的活去验
榜单测的是别人出的题,你手头的活长什么样,只有你自己清楚。
真想分出来,挑三个自己刚做完的真实需求,把当时的需求描述原样丢给两个模型各跑一遍。看的不是谁跑得快,是谁一次跑对的,谁让你回头改的次数少。顺手记一下两边的 token 消耗,折算成钱。
三五个任务跑下来,答案自己就浮出来了。谁少让你返工,就用谁。
模型是工具,不是信仰。便宜好用、能干活,比榜单吵架实在。
像我一直用的Coding Agent也没局限于某一家,claude code,codex、zcode、trae、WorkBuddy、deepseek-harness等等,太多了,每个的能力都不同,针对方向也不一样,所以还是看具体是做什么,还有用的人怎么做,每个人的感官不同,接下来还是百家争鸣时代,加油吧,国产大模型!
