Claude新模子46来了!更多饭碗没了:华尔街财政、
|
正在Cowork下,一边跑财政阐发,一边把研究拾掇成文档。
正在Agent编程评估Terminal-Bench 2。0中取得了最高分,并正在“人类最初测验”中领先所有其他前沿模子。
配套的effort参数供给四档选择——low、medium、high、max——,默认high,碰到模子过度思虑的环境能够手动调低。
从成就背后的现实能力来看,Opus 4。6能更缜密地进行使命规划,可正在大型代码库中不变运转,代码审查取调试精度提拔。
无论是复杂的法令、金融专业学问仍是刁钻的学术研究,它的推理理解深度都达到了目前frontier models的颠峰。
“当Agent起头编译Linux内核时曾一度卡住,由于这是一个巨型单体使命,16个Agent全撞正在统一个bug上互相笼盖。”。
正在OpenSC(处能卡数据的东西)和CGIF(处置GIF文件的东西)中发觉了缓冲区溢出缝隙;正在CGIF阿谁案例里,Claude以至自动写了PoC(概念验证代码)来证明缝隙实正在存正在。若是这成为将来开源软件平安审计的次要体例之一,他一点也不惊讶。
解法是引入GCC做为”oracle”对照组,让每个Agent只编译内核的随机子集,通过二分位问题文件,如许并行能力才线个零日缝隙,开箱即挖。
至多就说法而言,财政阐发、研究,以及Office三件套,Claude Opus 4。6都能够玩儿得贼溜。
Agent通过往current_tasks/目次写文件来”认领”使命,git的同步机制从动处置冲突。Agent之间没有特地的通信和谈,也没有编排Agent,每个Claude本人决定下一步干什么。
Opus 4。6带来的一项焦点能力升级是Agent Teams,即多个Claude实例并行协做,无需人类及时监视。能正在x86、ARM和RISC-V三个架构上编译Linux 6。9,还能跑Doom。
(这意味着Claude Opus 4。6正在大约70%的环境下正在这个评估中获得比GPT-5。2更高的分数,50%的环境下意味着分数相当)?。
正在Anthropic最看沉的从动化行为审计中,Opus 4。6的对齐程度极高,同时,、奉承等负面行为极低。
正在Pval-AA(一项评估金融、法令和其他范畴经济价值学问工做使命的机能目标)上,Opus 4。6比行业下一最佳模子OpenAI GPT-5。2超出跨越144个Elo哟~!
加量不加价,Opus 4。6的订价连结原有尺度:每百万token输入/输出,价钱是5美元/25美元。
自家工程师每天都正在用Claude Code编写代码,每个新模子起首都正在本人的工做中进行测试。
正在BrowseComp评测(评估正在线检索难获打消息的能力)中,Opus 4。6排名行业第一,深度多步调代办署理式搜刮表示最佳,能精准定位分离正在长文档中的环节消息。
正在发布前的测试中,Anthropic的前沿红队把Opus 4。6扔进一个沙箱,给它Python和常规缝隙阐发东西(fuzzer、debugger那些),没有任何特地指令或范畴学问,让它本人去找开源代码里的缝隙。
动静一出,金融数据办事商FactSet最惨盘中暴跌10%,S&P Global、穆迪、纳斯达克公司纷纷下跌,各大指数全线跳水。
正在GhostScript(一个处置PDF和PostScript文件的常用东西)中发觉了一个可导致解体的缝隙,并且是正在保守fuzzing和人工阐发都没找到问题之后,Claude本人翻了项目标git提交汗青才挖出来的。
好动静是加量不加价,Opus 4。6的订价连结原有尺度:每百万token输入/输出,价钱是5美元/25美元。 |


