deepseekDeepSeek-R1: Incentivizing Reasoning Capability in LLMs viaReinforcement LearningDeepSeek-AIresearch@deepseek.comAbstractSZOZWerze ITDSoJ 148t6ZI10SZAIXIDWe introduce our first-generation reas