项目详情
深入了解 llama-cpp-python 的功能与特性
默认情况下,from_pretrained将下载模型到huggingface缓存目录,然后您可以使用huggingface-cli工具来管理已安装的模型文件。
高级API还提供了一个简单的聊天完成接口。
聊天完成需要模型知道如何将消息格式化为单个提示。Llama类使用预注册的聊天格式(例如chatml,llama-2,gemma等)或通过提供自定义聊天处理程序对象来完成此操作。
模型将使用以下优先顺序将消息格式化为单个提示:
- 如果提供了
chat_handler,则使用它 - 如果提供了
chat_format,则使用它 - 使用
gguf模型元数据中的tokenizer.chat_template(对于大多数新模型应该有效,旧模型可能没有此功能) - 否则,回退到
llama-2聊天格式
设置verbose=True以查看所选的聊天格式。
聊天完成可通过Llama类的create_chat_completion方法进行。