前GitHub CTO开源模型,比肩Claude Opus

Poolside上周把Laguna系列全部开源了。Apache 2.0级别的许可,商用随便用。

Poolside创始人Jason Warner,前GitHub CTO,2023年从微软出来创业,团队从DeepMind、OpenAI、Meta挖了一堆人,融了40多亿美金,就干一件事:做AI编程模型。

Laguna不是聊天机器人,是个编程Agent。你给它一个项目,它自己读代码、找bug、改代码、跑测试。SWE-bench Multilingual拿了78.5%,跟Qwen 3.7 Max打平,编程能力已经摸到Claude 4.5 Opus的边了。

关键是,它最小的那个型号,你桌上那台4090就能跑。

它到底能干嘛

写代码最烦的事,改别人写的屎山代码。

一个祖传项目,几十万行,文档约等于没有,写这代码的人早就离职了。老板说"加个功能",你打开项目看了三天,愣是没看懂数据怎么流的。

Laguna干的就是这个活。你把整个项目扔给它——注意,是整个项目,不是复制粘贴几百行——它自己翻代码、理解架构、定位问题、写补丁、跑测试。

它有100万token的上下文窗口。Linux内核源码大概100万行,它一次性能全部读完。你那个十几万行的业务项目,对它来说就是翻几页纸的事。

而且它是Agent,有自主行动能力。你告诉它"这个接口返回500了,修一下",它会自己去翻日志、读源码、定位到具体哪一行、改完、跑一遍测试确认没搞坏别的地方。中间还会穿插推理链,先分析再动手,不是那种装模作样的"让我思考一下"。

三个型号,跟你有关的是最小的那个

Poolside一共出了三个:

Laguna XS 2.1,33B参数,激活3B。一张RTX 4090或者36GB内存的MacBook就能跑。SWE-bench Verified 70.9%,Claude Haiku 4.5是73.3%,一个137B的模型是71.6%。33B的小模型跟人家掰手腕掰到差不多。

Laguna S 2.1,118B参数,激活8B,100万上下文。SWE-bench Multilingual 78.5%。但这个你本地跑不了,最激进的量化也要31GB,24GB的4090塞不进去。想用的话租云GPU,或者直接在OpenCode平台上免费用。

Laguna M.1,225B,旗舰,普通人不用想了。

所以这篇重点讲XS 2.1。

33B参数怎么就能打137B的

传统大模型,比如一个70B的模型,你每问它一个问题,700亿个参数全部算一遍。就像一家医院,不管你是感冒还是骨折,全院所有科室的医生全部来会诊。

Laguna用的是MoE架构,混合专家。256个"专家",每问一个问题只挑10个最相关的来回答。

所以XS 2.1虽然总共33B参数,每次实际参与计算的只有3B。速度跟一个3B的小模型一样快,但知识面是33B的。你公司有个256人的技术团队,每次开会只叫10个相关的人,会议效率跟10人小会一样快,但背后有256人的知识储备。

还有一个省内存的设计:48层里面只有12层用全局注意力,剩下36层只看最近512个token。就像你读一本书,大部分时候只需要看当前这一页和前后几段,只有少数关键时刻需要翻回去看前面的伏笔。KV cache的内存占用因此大幅缩小。

手把手部署

Ollama(最简单)

装过Ollama的话一条命令:

ollama pull laguna-xs-2.1
ollama run laguna-xs-2.1

没装过去 ollama.com 下,Windows/Mac/Linux都有。跑起来之后本地开个API服务,任何支持OpenAI格式的工具都能对接。

llama.cpp(Windows推荐)

winget install llama.cpp

装完启动:

llama serve -hf poolside/Laguna-XS-2.1-GGUF:Q4_K_M

自动从HuggingFace下载Q4量化版(大概18-20GB),下完直接启动带Web界面的本地服务。

想要更快的推理速度,加上DFlash投机解码(Poolside专门训了个2B草稿模型来加速):

llama-server -m laguna-xs-2.1-Q4_K_M.gguf \
  -md laguna-xs-2.1-DFlash-BF16.gguf \
  --spec-type draft-dflash --spec-draft-n-max 7 -fa on --jinja --port 8000

DFlash需要Poolside自己的llama.cpp分支,上游还在合并:

git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build -j

vLLM(Linux/Docker,当服务跑)

pip install 'vllm>=0.21.0'

vllm serve --model poolside/Laguna-XS-2.1 \
    --tool-call-parser poolside_v1 \
    --reasoning-parser poolside_v1 \
    --enable-auto-tool-choice \
    --served-model-name laguna \
    --default-chat-template-kwargs '{"enable_thinking": true}'

启动后就是OpenAI兼容的API服务,localhost:8000/v1,Cursor、Continue、Cline这些AI编程插件直接对接。

想跑S 2.1(118B)

4090跑不了,别折腾。三条路:

1. OpenCode平台免费用,网页端直接体验

2. AutoDL租一张A100 80GB,NVFP4量化版71GB,vLLM一键起,按小时算钱

3. 64GB以上内存的话,llama.cpp加载IQ2量化版(35GB),GPU放一部分层剩下CPU扛。能跑,1-3个token每秒,体验可以干活别想

实际用起来什么感觉

拿一个3万行的FastAPI后端项目试了一下。

让它"找到用户注册接口的并发bug并修复"。

它花了大概20秒读项目结构,定位到auth模块,读了register函数和数据库session管理,发现session在并发请求下没有正确隔离。然后写了个修复补丁,用async with重新管理session生命周期,最后自己跑了一遍pytest确认测试通过。

整个过程我就看着。

最让我意外的是它的思考不是废话。很多模型的thinking就是车轱辘话来回说,Laguna是真的在推理:"session在请求结束后没有关闭→并发时两个请求共享同一个session→第二个请求读到了第一个的脏数据→需要在每个请求开始时创建独立session"。一步接一步,跟靠谱工程师debug的思路一样。

跟Claude、GPT比

Laguna XS 2.1不是来取代Claude Sonnet或者GPT-5的,那些是通用模型。Laguna是专科,只看编程。

但在编程这个科里:SWE-bench Verified 70.9%,Claude Haiku 4.5是73.3%,差距很小。免费,Claude和GPT要花钱。本地跑,代码不用上传到别人服务器。256K上下文,整个项目一次性读完。原生支持工具调用和Agent模式,不是后期硬加的。

独立开发者或者小团队,不想每个月给API交几百刀,Laguna XS 2.1目前同价位(免费)没有第二个选择。

注意事项

1. 它就是写代码的,你问它天气它会很困惑

2. 推理模式默认开着,简单代码补全可以关掉:请求里加 enable_thinking: false

3. 多轮对话别删之前的thinking内容,删了后续推理质量会下降

4. Q4量化够用,别纠结Q8或FP16,编程任务上质量损失很小,显存砍到四分之一

5. 许可证OpenMDW-1.1,商用修改分发都行,别绕安全护栏

展开阅读全文

更新时间:2026-07-28

标签:科技   模型   代码   项目   参数   上下文   测试   内存   团队   里加   架构

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top