1. Inkling: Our Open-Weights Model (thinkingmachines.ai)
Inkling:开放权重多模态基础模型发布
Thinking Machines Lab发布了其首个从头训练的开放权重基础模型Inkling,旨在构建可广泛定制、支持多模态推理的实用AI基础。作为模型家族的开端,Inkling采用混合专家(MoE)架构,总参数量975B,激活参数41B,支持长达100万token的上下文窗口,并在45万亿文本、图像、音频和视频token上完成预训练。与其同步预览的还有Inkling-Small(276B总参数,12B激活参数),采用改进的预训练配方,在更低成本与延迟下于多数推理和编码基准上接近完整版表现。
核心能力与性能
Inkling定位为广泛的通用基础模型,同时在智能体编码、多模态理解与可控推理方面具备突出特性。模型支持“可控思考努力”,允许开发者调节性能与token消耗之间的平衡,在Terminal Bench等任务中以约三分之一的token达到与同水平模型相当的性能。在代码与智能体领域,Inkling在SWEBench Verified(77.6%)、设计竞技场(Design Arena)网页开发榜单及长程迭代优化任务中表现优异。多模态方面,Inkling采用无编码器架构处理音频与视觉输入,在VoiceBench、MMAU、MMMU Pro及Charxiv RQ等基准上处于开放权重模型前列,并支持通过Python工具进行视觉辅助推理。
认识论与安全性
Inkling针对校准(calibration)、指令遵循和抗审查进行了专门的后训练。通过基于真实世界问题的强化学习,模型在ForecastBench和Prophet Arena等预测任务中展现了良好的概率校准与置信度表达能力。安全方面,Inkling在FORTRESS(区分拒绝有害请求与不过度拒绝良性请求)和StrongREJECT基准上与顶尖模型持平,是开放权重模型中内置安全防护最强的之一。
训练、架构与强化学习
架构上,Inkling的MoE层设计参考DeepSeek-V3(256 routed experts + 2 shared experts,每token激活6个专家),注意力层以5:1比例交错滑动窗口与全局层,并使用相对位置编码。训练采用Muon与Adam混合优化策略,后训练包含小规模SFT引导及大规模异步RL,累计超过3000万次rollout。RL过程中,模型推理性能呈对数线性提升,且思维链(chain of thought)自发地从冗长语法结构压缩为简洁、电报式的表达,同时保持可读性与答案准确性。
可用性与生态
Inkling及其配套微调平台Tinker现已上线,提供64K与256K上下文选项,并内置Inkling Playground供开发者直接体验。完整权重已在Hugging Face开源(含NVFP4高效推理格式),用户可通过TogetherAI、Fireworks、Databricks、Modal、Baseten等API服务调用,也可使用SGLang、vLLM、llama.cpp等主流框架进行本地部署与微调。配套工具包tml-renderer和开源cookbook进一步支持音频微调与复杂工具调用场景。