一、这一次,等得有点久

有些等待是温柔的,它不声张,只是某天早晨你打开手机,发现它已经悄悄来了。

DeepSeek V4不是这种。

从去年底开始,关于V4的消息就像电报一样不间断地传来:路透社说"未来几周",彭博社说"已在内测",国内社区更是把每一次DeepSeek服务器的细微抖动都当成发布前兆。中文互联网上有人在数日子,有人在押注,有人把DeepSeek的每一次沉默都解读成"即将出手"。

这种期待是有来由的。DeepSeek V3当年横空出世,用一个让硅谷集体失眠的价格,交出了足以与GPT-4掰手腕的答卷。那之后,"中国AI究竟能走多远"成了一个不再需要轻声询问的问题。V4的预期,就这样在等待中一层一层地被叠高——每推迟一个月,想象中的惊艳就多生长一分。

然后,4月24日,它来了。

发布公告简洁克制,没有发布会,没有喊麦,只有一行字:"今天,我们全新系列模型 DeepSeek-V4 的预览版本正式上线并同步开源。"

然后是技术参数,然后是那句古文,然后就没有了。


二、那个「预览版」三个字

我承认,看到"预览版"的时候,心里有一秒的停顿。

不是失望,更像是——哦,原来还不是全部。

这个停顿本身很有意思。说明这半年多积累的期待,已经把一个合理的"预览"都变成了略显仓促的入场。这不是DeepSeek的错,是我们的胃口被自己养大了。

但预览就是预览,它有预览的意义:真实的用户、真实的场景、真实的反馈。于是我打开了chat.deepseek.com,开始测。

第一个问题,我问它:现在是V4了吗?

它说:是的,就在昨天(2026年4月24日)……

今天是4月24日。

这个"昨天=今天"的时间错误,放在任何一次对话里都不算大事,但偏偏发生在发布当天的自我介绍里,有种说不清楚的喜感。一个刚刚宣布自己"在世界知识测评中大幅领先"的模型,在第一个问题里就把今天当成了昨天。

后来我追问它的版本——你是V4-Pro还是V4-Flash?它绕了好几圈:先说自己是V4,然后说自己是V3,然后说自己不确定,最后说"请以界面显示为准"。

这条版本认知的混乱,贯穿了整个测试过程。


三、它真正好在哪里

但如果就此打住,那就是偏颇了。

我用了几个小时测试它,其中一项是把我自己写过的几篇公众号文章全部喂进去,让它做文学风格分析——覆盖诗歌、乐评、历史长文和科技随笔。它的分析准确、细腻、有层次,甚至准确识别出了"冷感修辞"和"结构即论点"这样的写作特征,并给出了可以继续往深处探的追问。这不是简单的内容复述,是真正的理解。

逻辑推理那道题,它想了253秒。题目是这样的:

甲说乙在场,乙说丙说谎,丙说甲和乙都在场。三人中只有一人说了真话。谁在场?请逐步推理,不要跳步。

它给出了完整的真值表推导,先假设甲真,推出矛盾;再假设丙真,再次矛盾;最终确认只有乙说真话,因此乙一定不在场,甲丙状态不确定。步步有据,结论正确。有兴趣的读者可以自己也去测一测,看你们得到的结果是不是一样。

长文档的处理能力,和V3相比有肉眼可见的提升。官方公告里说的"百万字超长上下文",目前看是真实的进步,不只是参数上的噱头。

代码测试也过了——我给了一个反直觉的约束(不用canvas,只用div写俄罗斯方块),它执行了。游戏能运行,打到等级3。

所以它是有真实实力的。只是这实力,暂时还撑不起"比肩顶级闭源模型"的全面宣言——尤其是在它连自己是哪个版本都说不清楚的时候。


四、跑分之外,还有什么

这才是我想说的核心。

DeepSeek的每一次发布,都有一张耀眼的benchmark表格——数学、代码、知识问答,各项第一或接近第一。这是真实的,也是必要的。在硬指标上证明自己,是中国AI在重重封锁下突围的第一步,没有这张成绩单,就没有资格进入那扇门。

但门进去之后呢?

Anthropic的Claude,在跑分上从来不是最高的那个。但它有一件事做得很好:让人敢用。敢把真实的工作喂给它,敢把重要的文档交给它,敢在生产流里依赖它。这种信任不是来自benchmark,是来自一次次交互里积累的"它不会乱说"的感觉。

Claude Code被嵌进了无数工程师的日常工作流,不是因为它每次都完美,是因为它出错的方式是可预期的,它的边界是清晰的,它会在不确定的时候说"我不确定",而不是流畅地编一个答案出来。

这正是V4目前需要补上的那一课。

日期搞错是小事。但版本认知的混乱,背后是一个更深的问题:模型在面对自己"不知道"的事情时,选择了流畅地绕开,而不是直接认错。这个倾向,在日常聊天里顶多让人觉得滑溜,在真实的工作场景里,会让人不敢相信。


五、关于那句古文

「不诱于誉,不恐于诽,率道而行,端然正己。」

DeepSeek把这句话放在发布公告的最后,没有解释,就这么立在那里。

我读了很久。

这句话出自《荀子·非十二子》,荀子用它描述君子的理想状态:不被赞美所诱惑,不被诽谤所恐吓,依着正道走,端正地做自己。

这是一种姿态,也是一种宣言。在人人都在做发布会、做流量、做情绪营销的时代,DeepSeek选择了一行古文作为结语——这个选择本身,就已经在说话了。

它让我想起Anthropic。那家公司的创始人,当初离开OpenAI,不是因为穷,是因为他们觉得那条路走得太快、走得不安全。他们选择慢一点、审慎一点,宁愿在商业化上落后,也不愿在安全对齐上欠债。这个选择,在外人看来曾经是迂腐的,现在回头看,是有骨气的。

DeepSeek的这句古文,有同样的气质。

但我还是想多说一句。

"率道而行"不是"闭门行道"。超然是一种姿态,尘世才是真正的考场。DeepSeek如今已经是事实上的"国民AI"——使用它的人,远不只是研究员和工程师,还有写报告的、做设计的、搞创作的、想学点东西的普通人。这些人信任它,把时间和工作交给它,期待的不只是benchmark上的第一名,是一个用起来让人安心的伙伴。


六、我愿意为好的AI付费

说一件可能有点出格的事:我希望DeepSeek考虑推出付费版。

免费,是DeepSeek最大的竞争力之一,这一点毋庸置疑。但免费也有它的代价——当一个服务是免费的,用户很难建立起"我在为这个东西负责"的感觉,也很难要求它承担真正的生产级别的可靠性。

这个问题不只是DeepSeek面对的。放眼国内,Kimi已经在悄悄探索订阅制,智谱的GLM系列也在寻找从"模型"到"产品"的那条路。海外,Anthropic用Claude Pro把模型嵌进工程师和创作者的日常工作流,OpenAI的Plus、Team版本培养了一批真正的重度用户。付费的那部分人,得到的不只是更多次数,是一种不同的使用心态——我在认真用这个东西,它也应该认真对我。

中国不缺愿意为好东西付费的人。如果DeepSeek推出一个月费合理的Pro版本,承诺更低的幻觉率、更清晰的自我认知、更稳定的生产级响应,我相信会有很多人愿意掏这个钱。不是因为免费版不好,是因为他们想要一个敢真正用在工作里的版本。

宁愿付费,换来少一点"流畅的不确定"。


七、结语

DeepSeek V4来了,虽然迟了一点,虽然还是预览版,虽然还有一些边边角角还没打磨干净。

但它来了。

在芯片封锁、算力限制、国际打压的重重围堵之下,一家中国AI公司,用自己的节奏,走出了自己的路,把开源权重挂在了Hugging Face上,让全世界的人都可以下载、运行、研究。这件事本身,已经值得记录一笔。

「不诱于誉,不恐于诽。」这句话说起来容易,在AI军备竞赛的喧嚣里做到,不容易。

只是,在端然正己之余,也请多一些尘世的烟火气。让幻觉少一点,让回答再自信一点,让用户敢把真正重要的东西交给你。

不辜负那些等了大半年的人。

也不辜负"国民AI"这四个字。

2026年4月24日,V4发布当天