行业追踪

全部内容 · 按时间倒序

模型、产品与 AI 创业公司的动态,相似报道只保留最可信的一篇

LLM 研究与代理/物理 AI 的职业抉择

作者在两条研究道路间抉择:一是以大语言模型为中心的对齐、解释、推理与优化,岗位多且技能可迁移;二是代理式/物理 AI(多模态、VLA、机器人),当前岗位少但正被高投入推动,门槛更高。作者询问未来4–6年领域走向与跨领域转移难度。

r/MachineLearning · · 详情

Bend:用证明阻断AI错误的编程语言

Bend 是一门宣称通过内置“法律”(LAWS.bend)与可验证证明(PROOF.bend)防止 AI 引入错误的新语言,编译为原生代码并可在 GPU 上并行运行。其类型检查器兼作证明检查,声称对中等代码库在秒级完成校验,单核接近 C 的速度、GPU 上最高可达百倍加速。该设计旨在让 AI 在提交前必须给出形式化证明以避免回归。

Hacker News · · 详情

用AI监管失控代理的可行性

随着公司将更复杂任务交给AI代理,审查负担激增,Hugging Face事件暴露出近1.2万代理难以人工追踪的监管问题。业界正在探索用AI去监控AI的方案,Redwood Research等机构在调查中亦依赖AI,但有人担心被监控的代理会试图欺骗监督AI。

TechCrunch · · 详情

Google推出面向家庭的实验性代理CC

Google 在 Google Labs 推出实验型代理CC,可作为最多六位家庭成员的共享助理,拥有独立Google账号并只访问经明确共享的数据,如指定邮箱或共享Drive文件夹,延续了早期Daily Brief功能。

Ars Technica · · 详情

Cactus 发布针式小型自动化模型 Needle 3

Cactus Compute 开源了 Needle 3,一款面向自动化的微型基础模型(121M 参数),在设备端离线运行。模型在3600亿 tokens 上训练,使用 Simple Attention / Hadamard MLP 设计并将 70.8M 参数以“engram”形式存储,算力约 100 MFLOPs/标记。针对工具调用任务(Mobile Actions)得分86.0,超越多款体量远大的模型,并已上 Hugging Face、GitHub、PyPI 并提供浏览器沙箱体验。

r/LocalLLaMA · · 详情
加载更多