Cursor发布Grok 4.6,真正值得关注的不是“模型又变强了”,而是AI竞争的单位正在改变。过去比较benchmark、代码正确率和推理能力,未来更重要的问题可能是:完成一个真实任务,需要多少时间、成本和人工干预。Grok 4.6可以快速处理简单问题,也能在复杂任务上投入更长推理,说明模型正在学会根据任务难度动态分配计算资源。
更关键的是prototyping能力。Cursor强调它可以从high-level idea出发,研究陌生领域、设计application structure、实现核心功能,再根据反馈连续迭代。被压缩的不只是“写代码”的时间,而是idea→working prototype整条链路。过去需要产品、领域专家和工程师多轮协作的第一版产品,现在越来越可能由一个人加AI完成。
价格同样值得关注。标准版为$2/M input tokens、$6/M output tokens,Cursor称其能够以约三分之一的单任务成本达到Opus 5级别表现。如果真实工作流验证这一点,未来最重要的指标可能不是谁benchmark最高,而是intelligence-per-dollar-per-task。企业真正购买的不是token,而是完成任务的能力。
对药物研发也是如此。真正有价值的benchmark,不应该只测试AI会不会写R或Python,而应该测试完整链路:literature review→hypothesis→analysis plan→数据分析→debug→visualization→interpretation→report。能够稳定完成整个闭环的模型,才可能真正改变计算生物学和数据科学团队的生产方式。
AI Coding最终争夺的可能不是IDE,而是整个knowledge work的execution layer。当执行越来越便宜,人真正稀缺的能力将变成problem definition、judgment和system design。未来最有价值的人,不一定是执行最快的人,而是最会定义问题、设计系统和判断结果的人。
#Cursor #Grok46 #AI编程 #人工智能 #药物研发 #生物信息学 #计算生物学 #科研效率
