Ollama 新增工具调用支持
Ollama 现在支持 Llama 3.1 等模型的工具调用,可通过 tools 字段提供可用工具并接收 tool_calls 响应。支持的模型包括 Llama 3.1、Mistral Nemo、Firefunction v2、Command-R+,OpenAI 兼容端点也已支持工具调用。
推荐理由:Ollama 为热门模型新增工具调用能力并开放 OpenAI 兼容接口,用户可据此快速接入外部工具。
Ollama 现在支持 Llama 3.1 等模型的工具调用,可通过 tools 字段提供可用工具并接收 tool_calls 响应。支持的模型包括 Llama 3.1、Mistral Nemo、Firefunction v2、Command-R+,OpenAI 兼容端点也已支持工具调用。
推荐理由:Ollama 为热门模型新增工具调用能力并开放 OpenAI 兼容接口,用户可据此快速接入外部工具。
TensorFlow 2.17 已发布,二进制包为计算能力 8.9 的 GPU(如 NVIDIA RTX 40 系列、L4、L40)提供专用 CUDA 内核,同时停止支持计算能力 5.0,预编译包最低支持 Pascal 架构(6.0)。TensorFlow 2.18 将放弃 TensorRT 支持,2.17 是最后一个包含 TensorRT 的版本,并将支持 Numpy 2.0。
summary_zh: Continue 配合 Ollama 可在 VS Code 和 JetBrains 内本地运行开源 LLM 代码助手,支持自动补全与聊天。
Google 在 Google IO 2024 发布开源框架 Firebase Genkit,支持在 MacOS、Windows、Linux 及 Docker 容器中通过 Ollama 本地运行开源模型 Gemma。开发者可通过 npm install -g genkit 安装并使用 ollama pull gemma 下载模型,Genkit 默认运行在 localhost:4000。
TensorFlow 官方宣布 XNNPack 的全连接和卷积算子支持动态范围量化,Stable Diffusion 推理速度最高提升 6.2 倍,且无需校准数据集即可启用。从 TensorFlow 2.17 起,预编译二进制默认开启该能力。
推荐理由:原文给出动态量化在多个模型上的加速数据,读者可据此评估在旧设备上部署 AI 功能的可行性。
Ollama 支持 embedding 模型,可用于构建检索增强生成(RAG)应用,将文本提示与现有文档或其他数据结合。
Ollama 在 Windows 和 Linux 上推出 AMD 显卡预览支持,所有功能均可由 AMD 显卡加速。已支持 Radeon RX 7900 XTX、7900 XT、6950 XT、Vega 64、PRO W7900、Instinct MI300X 等系列显卡,更多型号即将推出。用户可下载 Ollama for Linux 或 Windows 开始使用。
TensorFlow 2.16 已发布,默认编译器改为 Clang 17(Windows CPU wheels),默认 Keras 版本升级为 Keras 3,并支持 Python 3.12。
summary_zh: 文章以 1928 年青霉素发现作类比,探讨 LLM 是否能成为自动驾驶的"意外答案"。传统自动驾驶依赖感知、定位、规划、控制四大模块,而端到端学习用单一神经网络替代各模块但存在黑箱问题。
Ollama 推出 Windows 预览版,支持拉取、运行和创建大语言模型,内置 NVIDIA GPU 与 AVX/AVX2 加速,无需配置或虚拟化。全量模型库可用,包括视觉模型如 LLaVA 1.6,支持拖图对话。API 默认在 localhost:11434 运行并兼容 OpenAI 接口,可通过 PowerShell 等工具直接调用。
Ollama 推出对 OpenAI Chat Completions API 的内置兼容支持,可使用 cURL、OpenAI Python/JS 库及 Vercel AI SDK、Autogen 等框架本地调用模型。
推荐理由:本地 Ollama 新增 OpenAI 兼容接口,开发者可沿用既有 SDK 与工具链对接本地模型。
TensorFlow GNN 1.0(TF-GNN)正式发布,是一个经过生产验证的、用于大规模构建图神经网络(GNN)的库。它支持在 TensorFlow 中进行建模和训练,并能从大型数据存储中提取输入图。TF-GNN 从底层构建,专为异构图设计,其中不同类型和关系由不同的节点和边集合表示。
LLaVA 1.6 支持最高 4 倍像素分辨率,并在文档、图表数据上训练以提升文本识别与推理能力。模型提供 7B、13B、34B 三种参数规模,采用 Apache 2.0 或 LLaMA 2 Community License 发布,可通过 ollama run llava:7b/13b/34b 调用。
summary_zh: Ollama 正式发布 Python 和 JavaScript 官方库,可通过 pip install ollama 和 npm install ollama 安装,仅需几行代码即可将应用与 Ollama 集成。
Jeremy Howard 与 Eric Ries 今日推出 Answer.AI,一家基于基础研究突破打造实用终端产品的 AI 研发实验室,获 Decibel VC 1000 万美元投资。团队为全远程深度技术通才,Jeremy 专注迁移学习与微调研究,Eric 带来精益创业与长期治理经验。实验室采用研发互驱路径,以实际开发目标指引研究方向。
TensorFlow 2.15.0 的 Python 包在 pip install tensorflow[and-cuda] 安装时错误依赖 tensorrt,导致部分用户安装失败或回退到 2.14。
TensorFlow Blog 宣布 TensorFlow Lite 的 XNNPack 后端支持半精度(FP16)推理,在 ARM CPU 上使浮点模型推理速度较 FP32 提升近 2 倍。
TensorFlow 2.15 已发布,Linux 的 NVIDIA CUDA 库通过 pip 安装升级到 CUDA 12.2,Windows x64/x86 默认启用 oneDNN CPU 优化。tf.function 类型全面可用,引入 TraceType、FunctionType 和 AtomicFunction;编译工具升级到 Clang 17.0.1 与 CUDA 12.2。
summary_zh: Spotify 利用 TensorFlow 与 TF-Agents 构建离线 Spotify 模拟器,用于在真实上线前原型设计、分析和训练推荐智能体。
summary_zh: 开发者使用 TensorFlow 训练强化学习智能体并转换为 TFLite 模型,再通过 Flutter TFLite 插件在 Android 和 iOS 上运行 Plane Strike 游戏。
summary_zh: People of AI 发布第二季,由 Ashley Oldacre 与新搭档 Luiz Gustavo Martins 共同主持,聚焦生成式 AI 的爆发式增长与技术变革。
Jacob Lee 演示了如何在浏览器端使用本地模型和开源工具构建 RAG 应用:文档分块、Xenova Transformers.js 嵌入、Voy 向量存储,以及通过 Ollama 暴露本地 Mistral 7B 模型给 Web 应用,并提供了可运行的 Next.js 示例和 LangSmith 追踪链接。
Ollama 发布官方 Docker sponsored 开源镜像,简化通过 Docker 容器使用大语言模型的方式。所有与 LLM 的交互均在本地进行,不将私有数据发送给第三方。Mac 上建议以独立应用运行以获得 GPU 加速,Linux 上可在 Docker 容器内为 Nvidia GPU 提供 GPU 加速,并通过 REST API 与应用交互。
summary_zh: Google 与 Tryolabs 发布开源 Python 库 Temporian,用于机器学习中时间序列数据的预处理与特征工程,并与 TensorFlow Decision Forests 配合训练预测模型。
summary_zh: Meta 两周前发布了 Code Llama 模型,提供 Instruct、Code、Python 三种变体。7B/13B/34B 参数版本均可用 4-bit 量化运行,Python 变体额外在 100B Python token 上微调。
summary_zh: TensorFlow 通过 DTensor API 原生支持分布式 FFT,用户只需将分片张量传入现有 FFT 操作(如 tf.signal.fft2d)即可,输出同样为分片张量。
Meta 今日发布 Code Llama,基于 Llama 2,在开放模型中提供最先进性能,支持代码填充、大上下文输入和编程任务零样本指令跟随。Code Llama 已上线 Ollama,提供 7B / 13B / 34B 三个参数版本,分别需要 16GB / 32GB 以上内存,并附带 Foundation 与 Python 两个专项分支。
TensorFlow Lite Flutter 插件已迁移至 TensorFlow GitHub 官方仓库并正式发布,支持在移动端、嵌入式、Web 和边缘设备本地运行 TensorFlow 模型。插件新增实时摄像头目标检测等功能,桌面端支持正在开发中。开发者可从 pub.dev 安装,并使用 Kaggle Models 等资源获取预训练模型。
summary_zh: Alan Kelly 通过 Simpleperf 对 TFLite 内存 Arena 初始化进行性能分析,发现 ArenaPlanner::ExecuteAllocations 占模型运行时的 54.3%。
Ollama 博客介绍如何在本地运行 Llama 2 uncensored 模型,并提供与原始 censored 模型的同 prompt 对比输出,涵盖电影、食谱、宗教文献、医疗信息和通用信息等场景。
TensorFlow 2.13 和 Keras 2.13 已发布,Apple Silicon wheels 首次亮相。Keras V3 格式成为 .keras 文件默认保存格式,提供更轻量、可读且安全的模型保存与加载。tf.data 新增 Dataset.zip 支持 Python 风格解包、Dataset.shuffle 支持全量打乱以及 pad_to_cardinality 转换。
Google Research 推出基于 TensorFlow Lite 的移动端胎儿超声评估模型,支持非专家通过盲扫协议获取孕周与胎位预测。模型在 Pixel 设备上实现 30 帧/秒以上实时推理,且无精度损失,并提供扫查质量反馈。
推荐理由:原文给出移动端实时推理速度与质量反馈机制,读者可据此评估该工具在低资源场景下的可用性。
summary_zh: Google 在 Google I/O 2023 将 PaLM API 以"public preview"形式开放,开发者可通过 PaLM API Chat 与 Text 服务在推荐系统中实现对话式推荐。
summary_zh: Google 将于 6 月 9 日在线举办首届推荐系统开发者峰会,TensorFlow 团队将分享 TensorFlow Recommenders、TensorFlow Ranking 和 TensorFlow Agents 等产品的使用经验。
Jeremy Howard 亲测 Mojo 并认为它是 Python 的高性能超集,可用 fn/struct 语法直接编写接近 C 速度的代码。Mojo 基于 MLIR 与 Python 语法构建,小团队快速实现演示,并强调其在部署时能生成类似 C 的独立小二进制文件。
作者用 Stable Diffusion、DALL-E 和 Midjourney 重制《Nemesis 2》1987 年开场动画,逐面板对比原版与 AI 生成效果。
summary_zh: Cohere 训练 GPT 类和 BERT 类大语言模型并通过 API 提供服务,支持微调。其创始团队包括 Google Brain 成员及原始 Transformer 论文合著者。
summary_zh: Stanford AI Lab 将 NeurIPS 论文 BanditPAM 开源,通过多臂赌博机将 k-medoids 聚类算法从 O(n²) 加速至 O(n log n)。
summary_zh: jiant 2.0 是一个基于 Python 的自然语言理解研究库,支持 GLUE、SuperGLUE 和 XTREME 等基准任务,兼容 BERT、RoBERTa、ALBERT、ELECTRA、XLM-R 等 transformers 模型。
summary_zh: NYU CILVR 是由 11 位正教授和 7 位附属教授领导、50 多名成员组成的机器学习实验室,覆盖计算机视觉、自然语言处理、神经科学、机器人等 AI 核心领域。