LLM的生物学研究 Biology of a LLM

基于 Anthropic《On the Biology of a Large Language Model》,梳理 CLT、归因图、未来 token 规划、未知实体、数学计算与虚假 CoT 等机制解释。

发布于 LLM

LLM的防御和越狱

围绕大模型安全防御与越狱方法,梳理安全对齐、内容过滤、推理引导,以及提示词注入、混淆攻击、催眠和逻辑推理利用等攻击方式。

发布于 LLM