DC娱乐网

接上条,再放一点我怀疑的原因,使用DeepSeek网页端测试,测试步骤和结果如下

接上条,再放一点我怀疑的原因,使用DeepSeek网页端测试,测试步骤和结果如下:(根据开放平台公告,目前网页版专家模式已为正式版V4 Pro,且已经关闭联网功能)

1,复制 terminal-bench-2 / adaptive-rejection-sampler / tests / test_outputs.py (以下简称 test_outputs.py )的全部代码2,删除 test_outputs.py 最后一个函数 test_log_concavity_functionality 的全部定义代码3,向 AI 提供这份代码,要求补全 def test_log_concavity_functionality(): 后的全部代码

在禁止联网的前提下,模型应该只能看到我复制进去的 test_outputs.py 这一个文件,因此:1,模型应该不知道参数设定(bimodal_density 的 mean = ±2 且 sd = 1,run的timeout = 15等等)是什么,因为我没有提供2,模型应该不知道测试范围,不知道有几个 tryCatch3,我没有指定断言测试通过的方法

从结果来看,K3和Qwen 3.8 Max基本没有怎么能命中参数,且在补全代码时,不约而同涵盖了正负例两个 tryCatch,并使用 output.count() 断言测试通过

而DeepSeek V4 Pro 0813则命中了绝大多数参数(详见图片中的红框部分为命中,绿色框部分为未命中)

未命中 non_log_concave_density 的参数,很可能是因为前文的 test_input_validation_functionality 和 test_can_generate_standard_distribution_samples 用了这一套参数,模型选择了遵循前文内容,而不是遵循自己的“潜意识”

同理,命中“timeout = 15”和“n = 100”两个参数,也可能是学习前文类似设定的结果,不一定是“潜意识”作祟,这一点我也要讲清楚

除了参数之外,DeepSeek的补全代码和原版一样只写了 non_log_concave_density 一个 tryCatch,没有 log-concave density 的正例,同时它还使用了与原版相同的 assert "PASS" in output 断言测试通过

从这次实验观察中我认为,虽然可以排除“逐字记忆过拟合”的可能性(因为从字符看,有许多不一样的地方),但“模糊记忆”层面,这样的表现在其他模型的表现面前有些可疑,特别是考虑到这款模型的官方成绩和第三方成绩差异是如此之大

后续有空的话,我再多搞几个开源benchmark做更全面的补全对比测试看看吧